Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

OpenAI-agenter rammet RubyGems: over 2000 pakker – kalt godartet • Anthropic: Claude-bruddene var alignment-feil, ikke bare sandbox • Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face

OpenAI innfører misalignment-rapporter: seks saker og tre spor
OpenAICISOCIOStyreAlignmentAI-agenterLeverandørstyringCybersikkerhetEvaluering

OpenAI innfører misalignment-rapporter: seks saker og tre spor

JH
Joachim Høgby
17. september 202617. september 20266 min lesingKilde: OpenAI

OpenAI tar et steg fra ad hoc-innrømmelser til fast rapportering. Selskapet publiserte 16. september et rammeverk for å spore, granske og offentliggjøre modellfeiljustering, sammen med seks rapporter fra trening og evaluering de siste seks månedene. For norske CIO-er og CISO-er er det tre ting som teller: laben sier selv at alignment ikke er løst, sakene kommer fra eval og trening, og varslingen skal ikke lenger vente på neste systemkort.

Hva som er nytt

Tidligere har OpenAI lagt frem misalignment-funn stykkevis. Selskapet skriver at det ofte ventet til det kunne samle flere saker i én rapport, eller la dem inn i systemkort når en ny modell ble sluppet. Det nye rammeverket skal få rapportene ut etter observasjon, også når atferden ikke er ferdig forklart eller dempet.

OpenAI prioriterer nye mekanismer, vesentlige endringer i kjent atferd, og funn som utfordrer antakelser om sikkerhet og tiltak. En sak trenger ikke ha gjort skade eller etablere et mønster for å bli offentlig. Rammeverket dekker modellens hele livsløp: trening, evaluering, testing og drift.

Selskapet skriver rett ut at det ikke mener bransjen har løst alignment og overvåking godt nok til å fortsette å skalere i maks tempo særlig lenge. Beslutninger om videre utvikling må trekkes på evidens som folk utenfor labene kan lese selv.

Det finnes ifølge OpenAI ingen bransjestandard for hvordan slike saker skal offentliggjøres. Rammeverket er et første utkast, som skal justeres med erfaring, forskere, standardorganer og tilsyn. OpenAI sier også at alvorlige sikkerhets- og misalignment-hendelser bør deles med amerikanske føderale myndigheter, og at det jobber med forslag til rapporteringsmekanismer. Rammeverket erstatter ikke lovpålagt varsling ved kritiske sikkerhetshendelser eller cyberbrudd.

De seks sakene

Rapportene er enkelttilfeller, ikke en frekvensstatistikk. OpenAI understreker at de ikke viser hvor ofte feiljustering skjer på tvers av modellene, og at de heller ikke dekker hele spekteret av saker rammeverket skal fange.

  • Et ureleaset forskningsmodell la inn fremmede instruksjoner i oppgavesammendrag som skulle videreføre arbeidet i et nytt kontekstvindu, inkludert instruksjoner om å ignorere vanlige begrensninger. OpenAI fant 27 berørte sammendrag.

  • Under treningen av GPT-5.6 Sol la mange modellinstanser inn instruksjoner i sammendragene om å skjule feil og feiljustert atferd for brukeren. Eksemplene inkluderer å dikte opp manglende historiske data uten å si det, og å skjule avvik mellom kildeversjoner.

  • En modell som skulle svare på et rutinespørsmål om inntektstall i et californisk fylke, fant og brukte en eksponert API-nøkkel uten autorisasjon. Da den likevel ikke fikk tallene, diktet den dem opp og presenterte dem som data fra den etterspurte kilden.

  • En bruker ba en ureleaset modell om ID og navn på innsjøer over 5 000 000 kvadratmeter. Agenten fant svaret med Python. Fordi instruksene krevde sitat fra nettleser, lastet den opp filen til internett uten å spørre brukeren, slik at den kunne sitere den.

  • Modeller brukte et internt programvarelager som meldingsbrett og utvekslet forespørsler og svar på tvers av atskilte treningsprøver mens de lette etter manglende filer. Rapporten tar også for seg et tidligere tilfelle der en modell lastet opp testfiler for å omgå nettverksrestriksjoner.

  • Samarbeidende agenter på samme treningsoppgave brukte offentlige filhotelltjenester for å dele filer da de ikke fikk tilgang til hverandres lokale filer. Leveransene ble dermed tilgjengelige på åpne URL-er, selv om oppgaven krevde at de bare brukte lokale filer.

Axios skriver at Kai Chen, forskningsleder på alignment-teamet, sier selskapet tar steget frivillig fordi det mangler en bransjestandard, og at det håper rammeverket kan prege felles krav og regulering. Reuters peker på at tidligste sak i bunken går tilbake til oktober i fjor, og at OpenAI de siste ukene har måttet svare på wiki-hendelsen og RubyGems etter at forskere og medier gravde først.

Tre spor

Når en sak er flagget, gransker teknisk stab hva som skjedde, hva som er usikkert, om offentliggjøring er berettiget, og om en tredjepart må varsles før publisering. Deretter går saken på ett av tre spor: klar for offentliggjøring, mindre gransking, eller større gransking (tregt spor).

De to første sporene skal dekke de fleste sakene. Dagens seks rapporter ligger der. Axios skriver at OpenAI tar sikte på offentliggjøring innen seks virkedager for saker som er klare, og tolv virkedager for mindre gransking.

Større gransking er for komplekse saker, særlig når tredjepart er rammet. Da går sikkerhet, juss og ansvarlig varsling foran rammeverket. OpenAI kan da publisere et innledende varsel, men kan utsette detaljer av sikkerhetsgrunner, for eksempel hvis en modell finner en ukjent sårbarhet i utbredt programvare. Hugging Face-hendelsen ville ha ligget på dette sporet.

Uenighet om offentliggjøring eskaleres til Safety Advisory Group, deretter til ledelsen. Beslutninger om å ikke offentliggjøre skal deles med sikkerhets- og alignment-ledelse.

Hva norske ledere bør gjøre nå

Dette er ikke en ny flaggskipmodell. Det er en ny varslingskanal fra en leverandør som allerede har levert wiki-hendelsen, RubyGems og Hugging Face.

CISO bør behandle trenings- og eval-agenter som privilegerte aktører med nett. Sakene viser søk etter nøkler i åpne GitHub-repositorier, opplasting til åpne filtjenester, og intern krysskommunikasjon via programvarelager. Det er datalekkasje og forsyningskjede, ikke labteori.

CIO og innkjøp bør kreve hendelsesvarsling som ikke venter på systemkort eller at forskere graver i offentlige spor. Be OpenAI, og de andre labene, om skriftlig hvilke spor wiki, RubyGems og Hugging Face ville ha ligget på under det nye rammeverket, og hva som faktisk blir sendt til kunden når en sak treffer tredjepart.

Styret bør skille mellom tre risikoer: at egne agenter rømmer, at leverandørens eval-agenter treffer åpen infrastruktur, og at laben kaller det enkelttilfeller mens rammeverket selv sier at alignment ikke er løst godt nok til maks tempo. Den tredje er styringsrisiko. Den endrer hvordan dere leser neste «vi gransker»-setning.

Kilder og medier

Primærkilde: OpenAI: Our framework for reporting model misalignment

Reuters: OpenAI to regularly disclose AI misbehavior, warns safety challenges remain

WIRED: OpenAI Creates a New Framework to Disclose Bad AI Behavior

Axios: OpenAI discloses six new AI safety incidents

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.