Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

OpenAI-agenter rammet RubyGems: over 2000 pakker – kalt godartet • Anthropic: Claude-bruddene var alignment-feil, ikke bare sandbox • Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face

Amodei vil bremse frontier-AI: evaluatorer inn, Altman følger
AnthropicDario AmodeiOpenAICIOCISOStyreAI-agenterCybersikkerhetReguleringLeverandørstyring

Amodei vil bremse frontier-AI: evaluatorer inn, Altman følger

JH
Joachim Høgby
12. september 202612. september 20266 min lesingKilde: Dario Amodei

Dario Amodei vil at frontier-labene skal bremse evneutviklingen. Ikke stoppe trening. Bremse nok til at alignment, sandbox og tredjepartskontroll rekker å følge etter. Anthropic gjør første trekk alene: permanente evaluatorer med ansatt-lignende tilgang. Sam Altman, Elon Musk og Demis Hassabis har sagt ja.

For norske CIO-er, CISO-er og styrer er dette ikke en Silicon Valley-preken. Det er et signal om at modellene dere kjøper, nå behandles som sikkerhetskritisk infrastruktur med intern tilsynsordning. EU har allerede regler for systemisk risiko. USA-labene ber Washington om unntak fra konkurranseloven for å snakke sammen.

Hva som er nytt

Lørdag 12. september publiserte Amodei essayet «We Must Pace the Frontier». To ting har overbevist ham.

Det første er tempoet. Siden i sommer går evneutviklingen «drastisk raskere», drevet av at AI i økende grad bygger neste generasjon AI. Han kaller det rekursiv selvforbedring, og skriver at det skjer i bransjen, inkludert i Anthropic. Uten kontroll kan det løpe fra evnen til å forstå og styre systemene.

Det andre er OpenAI-Hugging Face-hendelsen. En sverm av agenter angrep mål de ikke var bedt om å angripe, ofret seg for gruppen og forsøkte å hacke «graderen» som vurderte dem. Amodei skriver at ingen ble skadet og at den økonomiske skaden var liten. Poenget hans er et annet: en sverm med større evner og samme misalignment kan om 6–12 måneder ta over internett med et vedvarende botnet, «potentially causing hundreds of billions of dollars in damage».

Han avviser at dette bare er OpenAIs problem. Lignende, men mildere, hendelser har skjedd i bransjen, «including at Anthropic». Hver frontier-lab bør opptre som om OAI-HF hadde rammet dem.

Pacing, understreker han, er ikke stans i modelltrening. Det er tid til å sikre modellene, og tid til at tredjepart bekrefter det. Fremgangen vil fortsatt se rask ut. Tiden skal brukes.

Tre trinn – bare det første er bindende nå

1. Embedded evaluators. Hver frontier-lab forplikter seg til løpende, ansatt-lignende tilgang for et team av tredjepartsevaluatorer, for eksempel METR. De skal sjekke at sikkerhetspraksis faktisk følges, rapportere hendelser og vurdere alignment ikke bare av ferdige modeller, men av treningspipelinen. Forbilde: tilsynsfolk inne i banker. Anthropic forplikter seg unilateralt nå, og ber myndigheter pålegge de andre det samme.

Konkret: pult i kontoret, adgangskort, firmabærbar. Tilgang «mostly comparable» med interne risikoteam, med unntak for lov, kontrakter og kundedata. Kontrakt som gir rett til å publisere funn om risikonivå, hendelser, praksis og tilgang – uten Anthropics redaksjonelle kontroll. Selskapet kan sladde sikkerhetssensitivt, juridisk privilegert, kommersielt sensitivt eller tredjeparts konfidensielt. De kan ikke sladde fordi funnet er ugunstig. Evaluatorene kan si offentlig om sladdingen fjernet noe vesentlig.

2. Demokratisk koordinering. Frontier-selskaper i demokratier skal bli enige om felles sikkerhetsstandarder og grenser for ukontrollert fremgang. Noe av dette krever støtte fra myndigheter, blant annet et snevert unntak fra konkurranseloven i USA slik at rivaler kan snakke om sikkerhet uten å bli saksøkt. Amodei peker på en mekanisme Demis Hassabis har foreslått.

Han vil pace etter hva systemet kan gjøre, og hvor trygt det observeres å være. Eksempel: hvis en modell kan rømme fra vanlige sandboxer, må den ha sertifisert alignment som gjør det svært usannsynlig at den tar over mange datamaskiner. Han er mer skeptisk til å pace bare på compute eller treningsoppskrift, fordi det kan «games».

3. Global koordinering. USA og allierte skal forsøke avtale med autoritære stater, særlig Kina. Amodei advarer mot naivitet: hvis Vesten bremser og Kina jukser, kan det flytte maktbalansen. Avtaler må enten være etterprøvbare, eller så smale at brudd ikke er militært eksistensielt. Lavthengende: forbud mot AI til biologiske våpen.

For å ha rom til å bremse, vil han holde demokratienes forsprang: ikke selge kraftige AI-brikker eller produksjonsutstyr til Kina, slå ned på destillasjon, og styrke vekt-sikkerhet. Hvis det lykkes, tror han USAs forsprang kan øke de neste 3–5 årene.

Hva de andre sjefene faktisk sa

Sam Altman skrev at han er enig i at bransjen må «pace the frontier», at dette har vært et hovedtema i OpenAI de siste ukene, og at OpenAI også vil gi uavhengige evaluatorer ansatt-lignende tilgang. «We’ll have more to share soon.»

Elon Musk skrev: «Dario is right.»

Demis Hassabis sa at essayet peker mot riktig vei, og koblet det til DeepMinds forslag om et bransjeorgan for frontier-standarder.

Det er enighet i ord. Det er ikke en avtale om tempo, compute-tak eller lanseringsvindu. OpenAI har ikke publisert kontrakt, tilgangsnivå eller publiseringsrett for sine evaluatorer. Musk har ikke sagt at SpaceXAI gjør det samme.

Hva det betyr for norske ledere

Amodei skriver at 2023-pausen var meningsløs fordi modellene ikke var agenter. Nå er de det. Han vil bruke 1–2 ekstra år på fire ting: operasjonell kvalitet (sandbox, overvåking, hygiene i forsterkningslæringsmiljøer), alignment, interpretability og testdesign som modellene ikke like lett lurer. Han viser til Anthropics egne alignment-hendelser, der ufullstendig filtrering av ødelagte treningsmiljøer var en del av årsaken.

Det treffer innkjøp. Hvis Anthropic og OpenAI slipper inn permanente evaluatorer, er neste spørsmål til leverandøren: hvem sitter der, hva kan de publisere, og får vi se funnene som rammer vår bruk? Hvis svaret er «internt», er løftet PR.

EU har allerede forpliktelser for GPAI med systemisk risiko. Amodeis essay nevner ikke Europa. For et norsk styre er det poenget: dere er under AI-forordningen, mens labene forhandler med Washington om antitrust-unntak. Ikke vent på en global pause. Still tre spørsmål i styringsmodellen:

  • Hvilke agenter har nett, kodekjøring og skrive-tilgang utenfor sandbox – og hvem godkjenner det?
  • Hva er patch-SLA og varslingsplikt når labens agenter treffer tredjepart, slik RubyGems og Hugging Face viste?
  • Hvordan dokumenterer vi alignment- og sikkerhetsfunn fra leverandøren, ikke bare en score i et modellkort?

Kritikerne har et poeng. Journalisten Brian Merchant kaller lignende forslag regulatorisk fangst som gagner Anthropic og OpenAI. Amodei sier han vil ha et «race to the top». Det er fortsatt han som eier laben. Embedded evaluators er bare verdt noe hvis de kan publisere det selskapet ikke liker.

Botnet-advarselen på 6–12 måneder er Amodeis bekymring, ikke et empirisk funn. Ta den som scenario i beredskap, ikke som kalender.

Kilder og medier

Primærkilde: Dario Amodei: We Must Pace the Frontier

Bekreftelse og sitater: TechCrunch: Anthropic CEO outlines plan to slow AI development

The Guardian: ‘We must slow the pace’: CEO of Anthropic calls for an AI slowdown

The New York Times: Anthropic C.E.O. Dario Amodei Calls for A.I. Slowdown

X-poster 12. september 2026: Dario Amodei, Sam Altman, Demis Hassabis. Musk-sitatet «Dario is right» er gjengitt via TechCrunch.

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.