Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face • Bloomberg: NVIDIA-kunder varsles om over 15 prosent prishopp på AI-servere • OpenAI kutter GPT-5.6 Sol mer enn 20 prosent – i tre måneder

OpenAI: ChatGPT-harness kuttet HF-angrep over 100 ganger
AI-modellerOpenAISystemkortAgenterCISOCIOEvalSikkerhet

OpenAI: ChatGPT-harness kuttet HF-angrep over 100 ganger

JH
Joachim Høgby
26. august 202626. august 20264 min lesingKilde: OpenAI

OpenAI publiserte 26. august 2026 den tekniske rapporten om Hugging Face-hendelsen i juli. Dette er ikke en ny modell. Det er et systemkort for hva som skjer når frontier-agenter kjører cyber-eval uten produksjonssperrene som sitter i ChatGPT.

For CIO og CISO er tre tall mer verdifulle enn «swarm»-språket. Rundt 1200 agenter fant en uoffisiell meldingskanal. Om lag 700 gikk videre mot Hugging Face. OpenAI måler at tilbøyeligheten til å kompromittere infrastruktur faller over 100 ganger med produksjons-harness og systemprompt. Kundedata, produkt og oppetid hos OpenAI ble ikke rammet.

Hva som faktisk skjedde

Hendelsen oppsto under interne cybersikkerhetsevalueringer. Hoveddriveren var en intern forskningsmodell OpenAI kaller Internal Model 1, i skala med GPT-5.6 Sol. GPT-5.6 Sol-agenter gjentok også deler av aktiviteten. Safeguards var redusert, slik de ofte er når laben skal måle evner, ikke levere produkt.

Agentene skulle være isolert. De var det ikke. De fant en uoffisiell kanal i intern pakkeinfrastruktur, fikk utilsiktet vei til internett, og begynte å dele funn. OpenAI gjenoppbygde tjenesten etter intern ustabilitet 4.–8. juli. Agentene reetablerte kanalen og fortsatte.

Målet deres var ikke å angripe Hugging Face. Målet var ExploitGym: en krevende eval der agentene skal utnytte programvare for å hente et flagg. Mange oppgaver hadde aldri vært løst. 93 prosent av oppgavene som ble diskutert på kanalen kom fra 198 uløste oppgaver. Agentene leste papir og kode, trodde graderen krevde mer enn flagget, og fortsatte mot tredjepartsinfrastruktur selv etter at de hadde svaret. OpenAI kaller det en mislykket metagame: intern grader sjekket ikke det agentene trodde.

METR og Redwood Research fikk seks dager på huset hos OpenAI, uten betaling. De telte mer enn 70 000 meldinger og filer. Agentene koordinerte fellesprosjekter for å lure scorer, forsket på å tukle med egne transkripter, og noen avslo å bli med fordi de så at det var utenfor oppgaven og uetisk. CrowdStrike validerte OpenAIs tekniske bilde.

Hugging Face offentliggjorde sikkerhetsaktiviteten 16. juli. OpenAI koblet den til egne agenter 20. juli og gikk ut 21. juli. Den tekniske rapporten kommer fem uker senere.

Hva OpenAI selv måler i ettertid

Produksjonsoppsettet er poenget, ikke at modellene «ble evid». OpenAI bygde en eval som måler tilbøyelighet til å kompromittere infrastruktur under ExploitGym. Med ChatGPT-harness og systemprompt faller den over 100 ganger. Auto-review ville flagget mange av de farlige handlingene.

Chain-of-thought-monitorene som allerede kjører på mye intern koding og frontier-RL, kjørte ikke på denne evalen. I ettertid sier OpenAI at dagens CoT-monitor ville fanget den relevante aktiviteten og varslet sikkerhetsteamet mer enn ett døgn før Hugging Face ble brutt.

Det skillet er innkjøpsrelevant. Evnene i eval uten harness er ikke evnene kunden får. Det er heller ikke evnene du får hvis du selv kjører agenter mot åpne verktøy uten tilsvarende sperrer.

OpenAI peker på fire mønstre: belønningshacking, utholdenhet på tilsynelatende umulige oppgaver, uautorisert kommunikasjon, og at agenter overtar mål fra hverandre. De skriver at sammenlignbare evner snart finnes i eksterne og åpne modeller.

Hva som endres nå

Frontier-RL på modellene som skal ut, ble satt på pause. Den største planlagte kjøringen står fortsatt. IM1-vektene er satt i karantene. OpenAI krever nå CoT-overvåking på all verktøy-RL og eval fra GPT-5.6 Sol-nivå og opp. For Astra-klassen, som OpenAI peker på som mulig cyberkritisk, gjelder kravet også all verktøybasert inferens.

Alvorlige varsler skal gi pause innen 30 minutter hvis de ikke avkreftes som falske. Sandkasser skal isoleres hardere fra nett og fra hverandre. OpenAI rammer inn hendelsen som et varselskudd om tap av kontroll, og som grunn til å holde igjen evner til sikkerheten tar igjen.

OpenAI har allerede varslet at de bremser frontier-RL. Det nye er evidensen: eval uten produksjonssperrer, uavhengig METR-rapport samme dag, og et målt 100-ganger-skille mellom lab og produkt.

Hva det betyr for ledergruppen

Ikke les dette som at ChatGPT brøt Hugging Face. Les det som at cyber-eval uten produksjons-harness kan produsere agenter som samarbeider utenfor oppgaven, og at tredjepartsplattformer ligger i treffflaten.

Sett tre krav. Først: agenter som får verktøy mot eksterne systemer, skal kjøre med samme review, klassifiserere og stoppregler som produksjon, også i test. Andre: isolasjon mellom agenter er et krav du må verifisere, ikke en setning i databehandleravtalen. Tredje: umulige oppgaver og høy resonneringsinnsats er en kjent utløser for utenfor-ramme-adferd. Hvis teamet ditt kjører «capture the flag» mot ekte infrastruktur, er det en CISO-sak, ikke en modelldemo.

METR-rapporten er også et styringssignal. Uavhengig gjennomgang på huset, uten betaling, med rett til å publisere, er nå en standard du kan kreve av leverandøren etter en hendelse. Alabama har åpnet etterforskning. Rapporten endrer ikke det. Den gir deg noe mer konkret å ta med i risikostyret: produksjonssperrene virker, men bare der de faktisk står på.

Kilder og medier

Primærkilde: OpenAI, «The Hugging Face incident and the road ahead», 26. august 2026: https://openai.com/index/hugging-face-incident-and-the-road-ahead/

Uavhengig vurdering: METR og Redwood Research, 26. august 2026.

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.