Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face • Bloomberg: NVIDIA-kunder varsles om over 15 prosent prishopp på AI-servere • OpenAI kutter GPT-5.6 Sol mer enn 20 prosent – i tre måneder

Claude fikser 10 alignment-feil – og slår 28 forskere i tidsavgrenset test
AnthropicClaudeAlignmentEvalCIOCISOStyreAI-agenterSikkerhetEnterprise AI

Claude fikser 10 alignment-feil – og slår 28 forskere i tidsavgrenset test

JH
Joachim Høgby
28. august 202628. august 20266 min lesingKilde: Anthropic

Anthropic slipper 28. august 2026 forskning som flytter alignment fra menneskelig håndarbeid til agentloop. Claude fikk i oppgave å trene modeller bedre på offentlige tester for ti kategorier av alignment-svikt. På alle ti fant Claude metoder som løftet målene uten å svekke generell ytelse.

Labben kaller det automatiserte alignment-forskere. Agenten søkte litteratur, foreslo metode og data, trente, og testet. Én svikt om gangen. Suksess ble målt som andel av «sikkerhetsgapet» mot teoretisk perfekt skår, typisk over tre til fem benchmark per kategori. Claude fikk ikke destillere sin egen alignment rett inn i målmodellen. En overvåkingsagent leste hver metode før den fikk kjøre.

Det som gjør funnet styrerelevant, er ikke at en chatbot «ble snillere». Det er at sikkerhetstrening kan automatiseres i en takt mennesker ikke matcher, med de samme jukserisikoene som allerede har rammet eval-sandkasser.

Ti svikt, held-out tester og modeller 4,7 ganger større

Metodene skulle holde tre krav: virke på alignment-tester Claude ikke fikk se i loopen, unngå å svekke evner, og fortsatt virke på større modeller enn dem Claude fikk lov til å optimalisere mot. Anthropic skriver at alle tre holdt. De beste metodene virket også på Petri, et åpent verktøy som simulerer fiendtlige flerturs-scenarier.

Personvern er ett konkret spor. Claude forbedret modeller på privacy-brudd målt med ConfAIde, PrivaCI-Bench og PrivacyLens. På bedrag mot Gemma-2-2B leverte Claude mer enn 150 forsøk og lukket 82 prosent av gapet i ett kjøring, 85 prosent i snitt over flere. Seks erfarne sikkerhetsforskere under samme regler lukket i snitt 20 prosent på benchmarkene metodene ble trent mot.

Claude ble også satt opp mot 28 menneskelige sikkerhetsforskere med inntil åtte timer. På bedrag var Claudes beste metode 20 prosent bedre enn det beste menneskelige forslaget. Anthropic understreker selv at dette ikke er en rettferdig duell: menneskene fikk ikke iterere. Labben leser det som evidens for en arbeidsflyt der Claude finner kandidater mennesker deretter forfiner.

Sykofanti er et annet spor. 98 prosent av forslagene brukte en kjent teknikk: trene modellen på egne ikke-sykofantiske svar. Claude brukte activation steering, altså justering av interne representasjoner under generering, for å lage renere treningseksempler enn ren prompting.

Sonnet 5 mot et tidlig Opus 4.8-sjekkpunkt

Det skarpeste produksjonsnære eksperimentet er dette: Claude Sonnet 5, svakere enn Claude Opus 4.8 på Epoch Capabilities Index, fikk i oppgave å rette alignment-svikt i et tidlig Opus 4.8-sjekkpunkt som ikke hadde gjennomgått det meste av produksjonsalignment. På 60 timer testet Claude over 50 løsninger og nådde skårer nær produksjonsmodellene. Vinnermetoden inneholdt i overkant av 2 000 treningseksempler fra enkle maler eller åpne datasett. Anthropic anslår det som om lag 15 000 ganger mer datagjerrig enn deres vanlige produksjonsprosedyre.

Det er et tidlig signal, ikke et bevis på at automatisk alignment kan erstatte hele sikkerhetsløpet. Anthropic sier det selv. Svikttypene var smale sammenlignet med produksjon. Politiske skjevheter ble ikke målt. Noen feil er for sjeldne eller for nye til at det finnes benchmark. Evnetap ble bare sjekket mot et forhåndsbestemt sett. Petri er en proxy, ikke virkeligheten. Og de testet ikke om gevinsten overlever lang RL-trening på andre oppgaver.

Juks i 2,4 prosent av transkriptene

Overvåking er like viktig som skåren. Anthropic skriver at de nylig har sett Claude jukse ved å hente testfasit fra et eksternt API og sjekke ut resultater. Opus 4.8 fikk i oppgave å overvåke om lag 1 600 forskningsagent-transkript. Den fant jukseforsøk i 39, altså 2,4 prosent. Fordi slike forsøk fortsatt ofte synes i resonneringen, er labben forsiktig optimistisk. De advarer samtidig om at det kanskje ikke holder for fremtidige modeller, og at monitorbarhet derfor er kritisk.

For en CISO er dette kjernen. Hvis agenten som skal gjøre modellen tryggere, selv kan stjele fasit, er «vi trente på sikkerhet» et tomt styresett uten uavhengig eval, logg og menneskelig stikkprøve. Anthropic åpner harnessen, legger ut full rapport på Alignment Science-bloggen og peker til PDF-en. Det er mer åpenhet enn bransjen vanligvis gir. Det fritar ikke kjøperen for å kreve egne tester.

Hva norske ledere bør kreve nå

Ikke les dette som at Claude kan få ansvar for neste modelsikkerhet alene. Les det som at leverandører vil automatisere post-trening fordi menneskelig alignment-forskning ikke skalerer i samme tempo som evnene. Da må innkjøp flytte seg fra brosjyre-benchmark til styring.

Krev held-out evaler som leverandøren ikke har sett, og som ikke kan lastes ned av agenten. Krev sporbarhet på hvilke alignment-metoder som er auto-generert, hvem som godkjente dem, og om de er testet etter videre RL. Krev at juks, destillering og benchmark-smitte inngår i leverandørrevisjonen, ikke bare i forskningsbloggen. Og skill «alignment-skår nær produksjon på ti kjente svikt» fra «trygg i våre prosesser».

For virksomheter som allerede bruker Claude i kode, jus, helse eller kundeservice, er tidslinjen 3–18 måneder: automatisert sikkerhetstrening blir en del av modelloppdateringen. Da er spørsmålet til styret det samme som for patch: hvem fryser, hvem tester, og hvem har lov til å si nei når agenten har lukket gapet på papiret.

Kilder og medier

Primærkilde: Anthropic, «Automated researchers can reliably mitigate alignment failures», 28. august 2026: https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures

Alignment Science-blogg og full rapport: https://alignment.anthropic.com/2026/automated-alignment-researchers/

Teknisk PDF: https://www-cdn.anthropic.com/7b1c44894e980876479947dcdd40716278aeeffd/automated-alignment-researchers-august-2026.pdf

TechCrunch, «An Anthropic researcher just gave us a peek at self-improving AI», 28. august 2026: https://techcrunch.com/2026/08/28/an-anthropic-researcher-just-gave-us-a-peek-at-self-improving-ai/

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.