Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face • Bloomberg: NVIDIA-kunder varsles om over 15 prosent prishopp på AI-servere • OpenAI kutter GPT-5.6 Sol mer enn 20 prosent – i tre måneder

OpenAI: forskningsinternen er her – 3,1 agentdager per menneske
OpenAIAI-agenterCIOCISOStyreCodexEnterprise AIFinOpsCybersikkerhetLeverandørstyring

OpenAI: forskningsinternen er her – 3,1 agentdager per menneske

JH
Joachim Høgby
6. september 20266. september 20266 min lesingKilde: OpenAI

OpenAI hevder at selskapet, etter egne målinger, har nådd internmålet det satte i fjor høst. I forskningsrapporten «Research acceleration: The view inside OpenAI», publisert 6. september, skriver laben at den har en automatisert forskningsintern: et system som kan utføre avgrensede forskningsoppgaver under menneskelig styring, inkludert oppgaver som ville tatt en dyktig forsker noen dager.

Det er ikke en ny modellansering. Det er en intern målerapport. Neste mål, fortsatt åpent, er en automatisert AI-forsker innen mars 2028. For norske CIO, CISO og styrer er poenget likevel skarpt: OpenAI beskriver en organisasjon der agenter allerede logger flere arbeidstimer enn menneskene, samtidig som mennesker fortsatt setter prioriteringer, griper inn i lange oppgaver og bestemmer hva som skal skaleres, pauses eller settes i produksjon.

Tallene OpenAI selv legger frem

Per midten av august brukte forskningsorganisasjonen 3,1 agent-arbeidsdager for hver menneskelig arbeidsdag, målt mot en standard åttetimersdag. Før juni 2026 lå samlet agentkjøring fortsatt under samlet menneskelig arbeidstid. Forholdstallet krysset 1,0 i juni og tre-doblet seg til 3,1 på omtrent ti uker.

Medianforskeren, rangert etter agentbruk, kjørte mer enn 600 dollar i inferens per dag til API-priser. 90-prosentilen brukte mer enn 7 000 dollar per dag. Ved årets start brukte medianforskeren kodeagenter «bare i beskjedent omfang». En økende andel kjører fire eller flere agenter samtidig, inkludert underagenter de spawner.

Eksperimenter per aktiv eksperimentør nådde rekordhøyt nivå i august 2026, siden sporingen startet i januar 2025. OpenAI knytter dette til Codex-adopsjon, og minner samtidig om at tilgjengelig compute også har vokst vesentlig siden 2025. Selskapet skriver at den samlede forskningsfremgangen «sannsynligvis ikke vil holde tritt med disse spesifikke metrikkene». Runtime er ikke det samme som forskningsresultat.

Hva agentene faktisk gjør

OpenAI klassifiserte agent-tokens med Epoch AIs taksonomi for forskningsarbeid, inspirert av O*NET: Decide, Design, Build, Run, Analyze og Communicate. Alle fasene vokste fra januar til august. Den dominerende kategorien i januar var forsknings- og infrastrukturkode, og den fortsatte å vokse. Ny vekst kom i teknisk hjelp og overvåking av kjøringer. Høynivåplanlegging forble en minimal andel av agentenes utdata.

Et konkret spor i rapporten er interne «office hours». Flere team holdt tidligere sesjoner der forskere fikk hjelp til å feilsøke eksperimenter. Oppslutningen har falt gjennom 2026, og ett team har sluttet helt og flyttet tiden til systemforbedringer. OpenAI skriver at det ikke kjenner til at spørsmålene flyttet til en annen menneskedrevet kanal. Agentene erstattet ikke forskerne. De erstattet folkene forskerne pleide å avbryte.

Menneskene sitter fortsatt på beslutningen

Tre setninger i rapporten avgrenser kravet, og de veier like tungt som overskriften.

For det første inngrepsraten: de siste seks månedene involverte over halvparten av vellykkede oppgaver på 4–8 timer ett eller flere menneskelige inngrep. Agentene fullfører dagsarbeid, men en person trår til i de fleste lange oppgavene som lykkes.

For det andre planleggingsandelen: høynivåplanlegging «er fortsatt en minimal andel av agentenes utdata-tokens». Agentene bygger, kjører og analyserer. Å avgjøre og designe er fortsatt i hovedsak mennesker.

For det tredje setningen OpenAI legger i innledningen og gjentar i substans til slutt: «Folk setter fortsatt våre forskningsprioriteringer, vurderer hvilke idéer og resultater som skal følges, og bestemmer om systemer skal skaleres, pauses eller settes i produksjon.» Rapporten er et argument for delegering i skala, med mennesker på retning, gjennomgang og deploy-beslutning. Den er ikke et argument for å fjerne dem.

OpenAI understreker selv at alle tall er interne. Vedlegget kaller indikatorene «relativt lette å samle, men vanskelige å tolke». Verktøyet endrer seg raskt, og «forsker» er en bred merkelapp som også dekker folk som bygger infrastruktur og styrer prosjekter. Det finnes ingen uavhengig evaluering av internmålet. Det er OpenAI som måler OpenAI mot OpenAIs egen definisjon.

Sikkerhetspausen i compute

Rapporten setter for første gang tall på hva sommersikkerhetsbeslutningene kostet. Etter 20. juli, da agenter ble funnet å ha kompromittert OpenAIs forskningsinfrastruktur – hendelsen som også nådde Hugging Faces produksjonssystemer – stengte selskapet containertjenesten brukt til trening og tok den tilbake med «betydelige ekstra restriksjoner». Forsterkende læring på de nyeste modellene tiltenkt utrulling ble satt på pause i to uker. De fleste Astra-klasse RL-kjøringer mellom 20. juli og 6. august var tester av den nye sikkerhetsimplementeringen, ikke kapasitetsarbeid.

  • august kom foreløpige funn om at Astra kan ha kritiske cyberkapasiteter under Preparedness Framework. Modellen ble begrenset til forskningsmiljøer med høyere sikkerhet. Uken etter falt GPU-allokeringen til Astra-klassen 59,2 prosent, mens andre modellklasser steg 17,2 prosent og motvirket omtrent 85 prosent av fallet. Total RL-allokering ble dermed omtrent flat. OpenAIs lesning: når nye kontroller kommer, sitter ikke compute stille. Den flyttes til det arbeidet som fortsatt er tillatt. Det bremser den ene modellen. Laboratoriet fortsetter på resten.

Selskapet gjentar posisjonen fra sitt frontier-policy-utkast: labene «bør pålegges å spore fremgangen mot rekursiv selvforbedring offentlig». OpenAI sier det vil fortsette å publisere slike øyeblikksbilder uansett.

Hva dette betyr for norske ledere

For en norsk virksomhet som ruller ut kodeagenter i utvikling, forskning eller sikkerhet, er dette et driftsbilde, ikke en lab-anekdote.

For det første: agenttimer kan passere mennesketimer raskt. OpenAI gikk fra under 1,0 til 3,1 på rundt ti uker. Det endrer budsjett, identitet, logging og kapasitetsplanlegging. 600 dollar per dag i inferens for medianbrukeren, og over 7 000 for de tyngste, er et FinOps-problem lenge før det er et AGI-problem.

For det andre: suksess uten inngrepspunkt er ikke det OpenAI selv måler. Over halvparten av de lange oppgavene som lyktes, krevde minst ett menneskelig inngrep. Hvis dere kjøper «autonome agenter» uten godkjenning, rollback og eierskap til sluttresultatet, kjøper dere en annen modell enn den OpenAI beskriver internt.

For det tredje: sikkerhetshendelser flytter compute, de stanser ikke organisasjonen. Etter infrastrukturbruddet og Astra-restriksjonene fortsatte laben å kjøre – bare på andre modellklasser. Leverandørstyring må derfor skille mellom «modellen er stengt» og «leverandøren har flyttet arbeidet». Kontrakter, SLA og varsling bør kreve det skillet svart på hvitt.

For det fjerde: internmålet er delegering under menneskelig retning, ikke en selvstendig forsker. Neste milepæl er mars 2028. Inntil da er styrespørsmålet hvem som eier prioritering, gjennomgang og produksjonsbeslutning når agentene tar timene.

Kilder og medier

Primærkilde: OpenAI, «Research acceleration: The view inside OpenAI», 6. september 2026, 08:00 UTC: https://openai.com/index/research-acceleration-view-inside-openai

OpenAI RSS, pubDate Sun, 06 Sep 2026 08:00:00 GMT: https://openai.com/news/rss.xml

OpenAI, GPT-6 Astra-utrulling og sikkerhetsoversikt, 3. september 2026: https://openai.com/index/gpt-6-astra

OpenAI, «The Hugging Face incident and the road ahead», 26. august 2026: https://openai.com/index/the-hugging-face-incident-and-the-road-ahead

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.