Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face • Bloomberg: NVIDIA-kunder varsles om over 15 prosent prishopp på AI-servere • OpenAI kutter GPT-5.6 Sol mer enn 20 prosent – i tre måneder

Prime Intellect måler agenters AI-forskning på ekte GPU-jobber
Breaking
AI-modellerAI-agenterEvalueringFrontier AICIOCISO

Prime Intellect måler agenters AI-forskning på ekte GPU-jobber

JH
Joachim Høgby
14. august 202614. august 20264 min lesingKilde: Prime Intellect

Prime Intellect har publisert en av de mest interessante målingene av agentisk AI akkurat nå: 153 autonome kjøringer på nanoGPT optimizer speedrun, fordelt på 18 frontiermodeller og flere ulike agent-harness. Poenget var ikke å spørre modellene om teori. De fikk en sandbox, 8xH200-GPUer, et fast regelsett, ingen internett og en konkret FoU-oppgave: forbedre treningsoppskriften for en 124M-parameter GPT slik at den når valideringstapet på færrest mulig treningssteg.

Det gjør saken viktigere enn enda en statisk leaderboard. Dette er en test av om modeller kan drive faktisk forskningsarbeid over tid: danne hypoteser, skrive og endre kode, kjøre eksperimenter, lese tapskurver, håndtere støy, forkaste dårlige spor og bygge videre på svake signaler. For virksomheter som vurderer AI-agenter i utvikling, data science eller intern plattformbygging, er det akkurat denne typen evne som betyr noe. Ikke om modellen kan forklare AdamW på en pen måte. Om den kan gjøre noe nyttig når virkeligheten er rotete.

Hovedtallet er tydelig: Fable 5 fikk beste validerte resultat med 2 726 steg og lukket 81,7 prosent av gapet mellom Prime Intellects baseline og en menneskelig rekord. Opus 5 fulgte med 2 920 steg og 53,6 prosent lukket gap. Kimi K3 kom også sterkt ut, både i Prime Agent-harness og Kimi Code-harness. GPT-5.6 Sol, Sonnet 5, Grok 4.5, Qwen3.8 Max, DeepSeek V4 Pro og Grok 4.6 ligger lenger ned på denne konkrete testen. Tabellen er ikke en universell sannhet om intelligens. Men den viser et mønster ledere bør merke seg: modellforskjeller blir større når oppgaven krever langvarig eksperimentstyring, ikke bare ett riktig svar.

Den viktigste lærdommen er kanskje ikke hvem som vant. Prime Intellect skriver at ingen av modellene fant en fundamentalt ny optimaliseringsmetode. De beste modellene vant ved bedre forskningsdisiplin: de målte støy selv, testet borderline-resultater på flere seeds, re-ablaterte oppskriften når nye endringer kom inn, og hentet tilbake tidligere negative ideer når konteksten endret seg. Svakere modeller overtolket enkeltkjøringer, kastet ideer for tidlig eller lot egne feil i eksperimentoppsettet bli «bevis» på at retningen var dårlig.

For CIO og CISO er dette et nøkternt signal. Agentisk AI er ikke bare «kodegenerator med lenger prompt». Når agenter får varighet, verktøy og compute, blir styringsproblemet mer likt forsknings- og driftssystemer enn chat. Du må vite hva agenten har lov til å endre, hvordan resultater valideres, hvordan den hindres i å jukse på målet, og hvor mye kost den får lov til å brenne før gevinsten er dokumentert. Prime Intellects oppsett var nettopp interessant fordi det hadde faste regler, isolert miljø, verifiseringsscript og offentlig sporbarhet.

Det er også en påminnelse om at benchmark-design blir strategisk. Klassiske evals måler ofte kort horisont. Denne testen måler evnen til å holde en forskningsloop i gang over dager. Det er nærmere den virkeligheten selskaper bryr seg om: forbedre et pipeline-steg, optimalisere en modell, redusere feilrate, refaktorere et komplekst system eller finne bedre kontrollpunkter i et datasett. Der kan et lite metodisk forsprang bli stort når agenten får mange forsøk.

Samtidig må resultatet leses med bremsene på. Prime Intellect peker selv på varians, begrenset antall seeds og at nanoGPT-speedrun ikke nødvendigvis predikerer ekte modelltreningsgjennombrudd. Oppgaven er smal, feedbacken er rask og målet er klart. Det er ikke det samme som å finne en ny arkitektur eller bygge et produksjonssystem med sikkerhetskrav, dataavtaler og mennesker i loopen. Men som måling av autonom FoU-adferd er dette mer lederrelevant enn mye av modellstøyen på X.

Konklusjonen: virksomheter bør begynne å evaluere modeller på egne langhorisont-oppgaver, ikke bare på generelle rangeringer. Hvis AI-agenten skal brukes til utvikling, forskning, SOC-arbeid eller prosessforbedring, må evalen inneholde verktøybruk, tidsbudsjett, validering, kost, revisjonsspor og stoppreger. Prime Intellect viser en praktisk mal: gi agenten et avgrenset problem, gjør alle forsøk målbare, og sammenlign ikke bare sluttresultatet, men kvaliteten på eksperimentløkken.

Det er der forskjellen mellom demo og drift begynner.

Kilder og medier

Primærkilde: Prime Intellect — https://www.primeintellect.ai/blog/measuring-autonomous-research

Resultatside: https://www.primeintellect.ai/research/nanogpt-speedrun

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.