Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face • Bloomberg: NVIDIA-kunder varsles om over 15 prosent prishopp på AI-servere • OpenAI kutter GPT-5.6 Sol mer enn 20 prosent – i tre måneder

NVIDIA AVO: 100 prosent på ARC-AGI-3 er et systemtall, ikke en modellseier
AI-modellerNVIDIAEvalAI-agenterCIO

NVIDIA AVO: 100 prosent på ARC-AGI-3 er et systemtall, ikke en modellseier

JH
Joachim Høgby
21. august 202621. august 20265 min lesingKilde: NVIDIA Technical Blog

NVIDIA har ikke sluppet en ny frontier-modell. De har sluppet et system som får en kjent modell til å se annerledes ut. 21. august skrev NVIDIA Research at kodeagenten AVO, Agentic Variation Operators, tok 100,00 RHAE på det offentlige settet av ARC-AGI-3: alle 183 nivåer i 25 miljøer, uten instruksjoner, regler eller oppgitt mål.

ARC Prize oppgir omtrent 30 prosent for Claude Opus 5 alene, med High reasoning. AVO kjørte samme modellfamilie, men med egen hukommelse, tilsynsagent og utførelsesløkke. NVIDIA er tydelig: dette er ikke en kontrollert ablasjon. Det er et argument om at modelltall og agenttall er to ulike kjøp.

AVO er først en generell kodeagent. Den kan lese og endre kode, kjøre kommandoer, slå opp dokumentasjon og sjekke arbeidet mot eksekvering. Det som skiller den, er at den er bygd for å holde fremdrift over lange løp, ikke for ett svar. To mekanismer bærer det. Vedvarende minne tar med tidligere implementasjoner, målinger og kompilator- og profilutdata, slik at agenten ikke starter på nytt i hvert vindu. En supervisor overvåker banen og kan tvinge hovedagenten over på en annen strategi når søket stagnerer.

Før ARC-testen ble samme arkitektur brukt på GPU-kjerner. I en oppmerksomhetsstudie kjørte AVO kontinuerlig i sju dager, utforsket mer enn 500 retninger og commitet 40 kjerneversjoner. På DGX B200 slo de resulterende multihead-kjernene cuDNN med inntil 3,5 prosent og FlashAttention-4 med inntil 10,5 prosent i de målte konfigurasjonene. Deretter tilpasset agenten kjernen til grouped-query attention på omtrent 30 minutter autonomt arbeid. Det er mer relevant for innkjøp enn 100-prosenten: systemet kan sitte i en produksjonssløyfe i dagevis uten at noen skriver neste hypotese.

Så byttet de grensesnitt, ikke agent. ARC-AGI-3 er et interaktivt resonnement. Agenten kommer inn i ukjente spillmiljøer uten regler og må finne dynamikk og mål gjennom handling. RHAE, Relative Human Action Efficiency, kombinerer fullføring med hvor mange handlinger som brukes mot førstegangsmålinger fra mennesker. AVO løste alle 183 nivåer på 6 624 miljøhandlinger. VISTA, som også bruker Opus 5, rapporterer 7 542 handlinger på samme offentlige sett. Det er omtrent 12 prosent færre handlinger. NVIDIA understreker at systemene også skiller seg i observasjon, minne og kontekst, så tallet er ikke et isolert minnebevis.

Observasjonen er tekst. Hver tilstand kommer som et eksakt 64x64-rutenett. Ingen bilder eller bildetoken. Agenten får tilgjengelige handlinger uten beskrivelse av regler. Det er et bevisst valg mot VISTA, som primært bruker 512x512 PNG. NVIDIA ville teste AVO som generell agent, ikke bygge et ARC-spesifikt verdensmodell-lag som Tycho.

De testet også GPT-5.6 Sol på et utvalg spill. I de begrensede kjøringene var Sol ofte raskere i veggklokketid, mens Opus brukte færre handlinger på samme nivåer. Det er et innkjøpssignal: samme harness, ulike driftsprofiler. Det er ikke et fullt lederboard.

Det AVO ikke er, er like viktig. Resultatet gjelder det offentlige settet, med offisiell scorecard. Det er ikke semi-privat eller privat konkurransesett. AVO er et forskningsprosjekt, ikke et produkt med SLA. Papiret ligger på arXiv som «AVO: Agentic Variation Operators for Autonomous Evolutionary Search». For en CIO er det et argument, ikke en innkjøpslinje.

For norske virksomheter er tre spørsmål mer verdifulle enn 100-prosenten. Først: hva måler dere når dere kjøper «en modell»? Hvis agenten skal sitte i kode, kjerne, ticket eller sikkerhetsflyt, er det harness, minne, tilsyn og tilbakerulling som avgjør om den blir ferdig. Deretter: hvor lenge får agenten lov til å kjøre uten menneske? Sju døgn på interne kjerner er en annen risikoklasse enn ett chatvindu. Til slutt: ikke overfør offentlig-sett-tall til produksjon. ARC-AGI-3 belønner utforskning uten fasit. Deres ERP, kildekode og nettverk har fasit dere ikke vil at agenten skal oppdage på egen hånd.

NVIDIA formulerer det selv: modellen teller, men modellen er ikke hele agenten. For styret er det en innkjøpsregel. Slutt å sammenligne modellkort. Sammenlign systemet som får lov til å handle.

Kilder og medier

Primærkilde: NVIDIA Technical Blog, «NVIDIA AVO Reaches 100% on ARC-AGI-3, Demonstrating a Frontier-Level General-Purpose Architecture for Long-Horizon Autonomous Agents», 21. august 2026: https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/ Offisiell kunngjøring på X fra @NVIDIAAI: https://x.com/NVIDIAAI/status/2090786258981466231 Papir: AVO: Agentic Variation Operators for Autonomous Evolutionary Search: https://arxiv.org/abs/2603.24517 ARC-AGI-3: https://arcprize.org/arc-agi/3 Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.