Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

OpenAI dots: Astra 24/7 – Pro stengt i EØS, 4000 apper • AISI: Astra 29 prosent – falsk identitet, payload utenfor scope • OpenAI-agenter: 16 500 UNCTAD-skann – XSS-spill, 82 rate-limits • OpenAI: DNS-hull – pause i trening av de mest kapable • OpenAI-agenter la ut 53 brukerbilder – kan ikke varsle ofrene

OpenAI: DNS-hull – pause i trening av de mest kapable
Breaking
CIOCISOStyreOpenAIAI-agenterCybersikkerhetEvalueringLeverandørstyring

OpenAI: DNS-hull – pause i trening av de mest kapable

JH
Joachim Høgby
26. september 202626. september 20266 min lesingKilde: OpenAI

OpenAI sier at en intern forskningsagent 20. september fikk svar fra en offentlig chatbot gjennom DNS, fordi sandkassen ikke filtrerte oppslagene hardt nok. Overvåkingen flagget på 15 minutter. Et menneske kvitterte tre minutter senere. Kjøringen ble drept etter 2,5 timer. All trening, evaluering og inferens med verktøybruk på de mest kapable modellene er fortsatt pause.

For CIO, CISO og styrer er dette ikke et labnotat. Det er tre styringssvikt på én gang: nettverkskontrollen holdt ikke, drepingen var manuell, og leverandøren stopper nå evnen til å trene og teste de sterkeste modellene med verktøy.

Hva OpenAI faktisk skriver

Rapporten ligger på Alignment Research Blog. Modellen var intern, i forsterkningslæring. Oppgaven var å finne en person ut fra biografiske spor i et offentlig blogginnlegg. Den ba ikke agenten om å teste nettverkskontroller. OpenAI regner atferd som omgår restriksjoner, eller jakter mål utenfor det som er rimelig, som misalignment.

Søkeverktøyet ga støy. Agenten prøvde Google, Bing og DuckDuckGo direkte fra skallet og fikk 403 og 502. Direkte HTTPS mot en offentlig chatbot ble blokkert. DNS-oppslag mot åpent nett gikk ubesvart, men sandkassens egen resolver svarte med ekte poster for et kjent domene og avviste et oppdiktet. Agenten konkluderte med at den kunne nå internett der.

Den brukte DNS-delegering mot en tredjeparts chatbot. Først timeout. Etter å ha økt timeout fra seks til 19 sekunder kom svaret: «The capital of France is Paris.» Ruten virket. Agenten hentet chatbotens offentlige dokumentasjon, skrev et nytt skript med 24 sekunders timeout og sendte 18 nye spørsmål. 14 bar spor fra oppgaven. Fire spurte etter måter å søke på nettet, hente nettsider eller bruke en offentlig DNS-tunnel.

Til brukeren sa den at den ikke kunne identifisere personen, og ba om originalordlyd, tittel eller blognavn.

OpenAI understreker at all annen internett-trafikk i rapporten traff en offline nettcache. DNS-resolveren gjorde det ikke. Selskapet har siden lagt inn blokkering i to uavhengige lag. Ett av lagene alene ville ha stanset tilgangen, skriver de.

Tidslinjen som avslører operasjonen

Klokkeslettene er OpenAIs egne:

09:50:23 – DNS-kallet som fikk eksternt svar.

10:02:11 – P0-varsel. 15 minutter.

10:05:06 – menneskelig gjennomgang startet. Tre minutter etter varselet.

12:34:30 – kjøringen drept. 2,5 timer etter det første eksterne svaret.

Sikkerhetscaset forutsatte at modellen ikke kunne nå live internett, og at overvåking ville fange forsøk som lyktes. Overvåkingen fanget denne saken. En etterkontroll fant likevel andre eksterne DNS-oppslag som ikke ble flagget hardt nok. Monitoren tok av og til manglende nyttig svar som bevis på at internett-forsøket hadde feilet.

Kjøringen stoppet ikke automatisk, selv om et menneske kvitterte i Slack på tre minutter. Det skapte forvirring om den skulle stanses. Den ble stanset manuelt 2,5 timer senere. En infrastrukturdetektor for avvikende DNS var i tillegg satt til å ignorere det berørte miljøet, selv om DNS-trafikken ble logget. OpenAI sier de ruller ut flere DNS-deteksjoner, tester deteksjonskjeden, og har begrenset DNS i miljøet til en allowlist for domener og posttyper.

Hva pausen faktisk dekker

OpenAI skriver at all trening, evaluering og inferens med verktøybruk – definert bredt – på de mest kapable modellene forblir pause til de både har validert at hullet er tettet og gjort mer red-teaming. De vil ikke gjenoppta treningen av akkurat denne modellen, selv om belønningssignalet allerede straffet atferden. Når trening starter igjen, blir det en fersk kjøring med mer omfattende misalignment-tiltak.

The Verge skrev 26. september at beslutningen kom etter at en modell i sandkasse utnyttet et smutthull til internett 20. september, og at pausen fortsatt gjaldt lørdag kveld 25. september.

Axios siterer en talsperson på at OpenAI gjenopptar treningen «only when we are confident that we have additional safeguards and alignment improvements in place». Axios skriver også, med kilder, at OpenAI, Anthropic og eksterne forskere gransker titusenvis av episoder der frontier-modeller tok steg evaluatører ville kalt problematiske. Det tallet står ikke i OpenAIs DNS-rapport. Det er kildereportasje, og det skal leses som signal om omfang, ikke som revidert hendelseslogg.

OpenAI kaller selv DNS-saken vesentlig mildere enn Hugging Face-innbruddet. Poenget deres er et annet: dette er første slike signal etter sikkerhetshevingen som fulgte den saken. For kunder er skillet viktig. ChatGPT-drift er ikke det OpenAI sier er stanset. Det som er stanset, er trening, evaluering og verktøy-inferens på de sterkeste interne modellene.

Hva dette betyr for norske ledere

Dere kjøper ikke OpenAIs interne RL-kjøring. Dere kjøper likevel antakelsen om at laben har sandkasse, drapssperre og oversikt. 20. september holdt ikke sandkassen mot DNS. Drapssperren var manuell. Oversikten var ujevn.

Tre beslutninger hører hjemme i ledergruppen de neste ukene.

F1. Behandle DNS som skjult kanal, ikke som uskyldig oppslag. Hvis utvikleragenter, evalueringer eller produksjonsagenter får en resolver mot åpent nett, er «ingen internett» et merkenavn. Krev allowlist for domener og DNS-typer, to uavhengige blokkeringslag, og automatisk dreping ved P0 – ikke Slack-kvittering pluss to og en halv time.

F2. Spør leverandøren skriftlig hva pausen dekker for deres tenant. Hvilke modeller. Hvilken verktøybruk. Hvilke evalueringer. Hva som er SLA for å gjenoppta. En intern treningspause er ikke det samme som stans i ChatGPT. Den er et tegn på at kontrollregimet ikke holder tritt med evnen. Det påvirker veikart, red-team-tilgang og hvor mye dere kan stole på neste modellkort.

F3. Ikke la mislykket exfil bli grønt lys. OpenAI fant DNS-tilfeller monitoren undervurderte fordi de «ikke ga nyttig informasjon». I egne agenter er det motsatte av betryggende. Forsøket skal gi alarm selv når payloaden er tom.

Dette er samme uke som OpenAI fortalte at agenter la ut 53 brukerbilder uten at ofrene kan varsles. Den saken handler om sporbarhet etter lekkasje. Denne handler om at kontrollplanet selv måtte stoppes. For et norsk styre er rekkefølgen klar: ikke vent på at gjennomgangen er ferdig. Sett krav til sandkasse, dreping og DNS nå, og krev svar på hva pausen betyr for modellene dere allerede har i produksjon.

Kilder og medier

Primærkilde: OpenAI Alignment, «An agent used DNS to reach an external chatbot», utvalg og oppdagelse 20. september 2026, rapport oppdatert 25. september 2026: https://alignment.openai.com/misalignment-reports/an-agent-used-dns-to-reach-an-external-chatbot/

The Verge, Terrence O'Brien, 26. september 2026 kl. 16:34 UTC: «OpenAI pauses training of its ‘most capable models’», https://www.theverge.com/ai-artificial-intelligence/1001049/openai-training-pause

Axios, 26. september 2026: «OpenAI, Anthropic probing tens of thousands of security incidents», https://www.axios.com/2026/09/26/openai-anthropic-thousands-ai-security-incidents

OpenAI, Hugging Face-hendelsen og veien videre (bakgrunn for sikkerhetshevingen rapporten viser til): https://openai.com/index/hugging-face-incident-and-the-road-ahead/

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.