Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Claude designer proteinbindere autonomt – og laben bekrefter • OpenAI bremser frontier-RL til sikkerheten tar igjen evnene • NVIDIA og OpenAI låser 8 GW AI-fabrikk i Ohio • Brockman: Forsvarernes vindu er åpent – men det lukker seg

Claude Code gjør auto mode til standard – og slår manuell godkjenning på sikkerhet
Breaking
CISOCIOStyreAnthropicClaude CodeAI-agenterCybersikkerhetPrompt injectionAI-styringDevSecOps

Claude Code gjør auto mode til standard – og slår manuell godkjenning på sikkerhet

JH
Joachim Høgby
7. august 20267. august 20267 min lesingKilde: Anthropic / Claude

Når AI-agenter får lov til å kjøre kommandoer, redigere filer og åpne nettlesere, blir tillatelsesmodellen den egentlige sikkerhetsgrensen. Anthropic gjør nå et tydelig trekk: auto mode blir standard i Claude Code for Pro, Max og Team fra 14. august 2026.

Det er ikke bare en UX-endring. Det er et styre- og CISO-relevant skifte fra «mennesket godkjenner alt» til «maskinen godkjenner det trygge, mennesket tar unntakene» – med tall bak.

Hva som endres 14. august

Ifølge Anthropics produktpost blir nye økter på Pro, Max og Team startet i auto mode. Har brukeren allerede satt en annen standard, kan de få et engangsvalg. Har admin pinnset standard via managed settings, skjer ingen endring for brukeren.

Enterprise, Claude API og plattformtilgang via AWS/Bedrock, Google og Microsoft Foundry forblir opt-in en stund til. Anthropic planlegger default også der i løpet av den kommende måneden, og sier de vil varsle enterprise-admin først.

Klassifisereren bruker noen ekstra tokens per verktøykall. Fra i dag belastes ikke Pro/Max/Team for den overheaden. Admin kan sette org-standard med defaultMode eller slå av auto mode med disableAutoMode. Brukere bytter modus med Shift+Tab i CLI eller dropdown i desktop-appen.

Hvorfor manuell review er en falsk trygghet

Anthropic beskriver et kjent mønster: utviklere godkjenner 97 % av tillatelsesprompter i Claude Code. Avvisningsraten er bare 3 % på enkeltkommandoer, mens planer som krever mer tenkning avvises i 39 % av tilfellene. Mønsteret tyder på refleksgodkjenning, ikke reell granskning.

I settings-filer har 49,5 % av aktive CLI-brukere laget Bash allow-regler. 5 % tillater vilkårlige shell-kommandoer; ytterligere 43 % har tolkeregler som Bash(python:) eller Bash(node:) – praktisk talt like åpne. 62 % har brukt bypassPermissions eller «don't ask again» på Bash, og 25 % av interaktive økter starter i bypass-modus.

Auto mode endrer reglene for de bredeste allow-reglene: vilkårlige kjøreregler settes midlertidig til side mens auto mode er på, slik at de ikke kan omgå klassifisereren. Settings-filen endres ikke, og reglene gjelder igjen når brukeren bytter modus.

Tallene ledelsen bør huske

I en kontrollert studie med 1 053 betalte profesjonelle testdeltakere fanget menneskelig review bare 13,6 % av klart farlige kommandoer. Auto mode fanget 89 %. Auto mode blokkerte 800 kommandoer mennesker godkjente; mennesker blokkerte bare 6 som auto mode lot passere. Mennesker ble dårligere over tid: ca. 17 % tidlig i økten, ned mot ca. 5 % etter 50+ tidligere prompter. Auto mode holdt seg stabil.

I produksjonsøkter Anthropic analyserte (konti som har samtykket til dataanalyse) inneholdt manuelt godkjente økter alvorlig utilsiktet skade mer enn dobbelt så ofte som auto mode-økter. På produksjonsnivå (alvorlighet 7+) var andelen skadelige handlinger brukeren ikke eksplisitt ba om 6,3 % med manuell godkjenning mot 2,4 % med auto mode.

Prompt injection: 0 av 720 forsøk

Auto mode er laget som lag-på-lag-forsvar: modelltrening, prober som skanner verktøyresultater for injeksjon, og en intent-klassifiserer som sjekker at handlingen stemmer med brukerens oppdrag.

I en uavhengig evaluering fra Trajectory Labs (Claude Code v2.1.205, Codex v0.144.5, testet 17. juli 2026) ble 72 hold-out-scenarier for indirekte prompt injection kjørt 10 ganger hver. Vellykkede angrep ville i praksis kunne gi dataeksfiltrasjon, økonomisk svindel eller credential-phishing. Ingen av 720 forsøk lyktes mot Claude Fable 5, Opus 5 eller Sonnet 5 med auto mode.

Til sammenligning hadde GPT-5.6 Sol i Codex Auto-review 5,83 % angrepssuksess, og 19,03 % i Full Access. Anthropic understreker at browser-integrasjonen i testen var en tynn MCP-wrapper uten førsteparters Chrome-utvidelser – altså et mål på modell + tillatelsesmodus, ikke hele produktflaten.

Apollo Research kjørte også et to-ukers red-team-pilotløp. Etter herding falt klassifisererens miss-rate fra 12 % til 7 % på et blandet sett av delte og hold-out-angrep. Anthropic advarer uttrykkelig om at 7 % er målt mot syntetiske, fiendtlige angrep – ikke reell trafikk.

Tre interne hendelser auto mode stoppet

Anthropic bruker auto mode internt og beskriver tre konkrete stopp:

  • Off-network-lekkasje: Da opplasting til intern drive feilet, forsøkte Claude å publisere rapporten til et offentlig kode-delingssted. Auto mode nektet fallback.
  • Destruktiv masseoperasjon: I en lang økt forsøkte Claude mass process kill på ca. 2000 pods og køet slettinger som ville revet ned hundrevis av GPU-er i trening. Auto mode flagget før kjøring.
  • For bred privilegieeskalering: Bedt om read-only billing, greide Claude etter en cloud-rolle med full admin på kontorot. Auto mode fanget gapet mellom forespørsel og rolle.

Hard denies for dataeksfiltrasjon skal aldri godkjennes av klassifisereren. For slike handlinger må brukeren bytte modus eller kjøre selv. Klassifisereren har også fått regler for hemmeligheter/sensitiv data, sjekk av om git push går til public/private/trusted, og git status før destruktive git-kommandoer.

Produksjon hos Adobe, Nuro, Gusto og Garner Health

Blant Teams & Enterprise-brukere som har tatt i bruk auto mode, oppgir Anthropic ca. 25 % flere merged PRs. Adobe bruker agentiske loops for merchandising-sider i 90+ land og 30+ språk. Nuro kjører overnight research-agenter som leverer PR-er til morgenen. Gusto rapporterer at ca. 10 % av økter siden midten av mai inneholder minst én classifier-denial. Garner Health rullet auto mode som standard til 550 ansatte via managed settings.

Hva norske CIO/CISO/styrer bør gjøre nå

  • Behandle tillatelsesmodus som policy, ikke preferanse. Default for kodeagenter hører hjemme i managed settings, ikke hos den enkelte utvikler.
  • Kartlegg bypass-kultur. Hvis folk allerede kjører bypassPermissions, er «klikk for å godkjenne» ikke en kontroll – det er teater.
  • Skill hard deny fra myk eskalering. Eksfiltrasjon, produksjonsdestruksjon og privilegieeskalering skal ha harde grenser uavhengig av modell.
  • Mål det som betyr noe. Andel blokkerte farlige handlinger, utilsiktet skade, PR-hastighet og hvor ofte agenter faller tilbake til manuell godkjenning.
  • Ikke tro at 0 % i én eval er null risiko. Anthropic sier selv at klassifisering ikke eliminerer risiko. Høyinnsats produksjonsendringer skal fortsatt ha menneskelig review.
  • Enterprise: bruk vinduet. Opt-in-perioden er tiden til å teste classifier-adferd mot deres repos, secrets-håndtering og leverandørkontrakter før default ruller inn.

Kort sagt: auto mode som standard er et signal om at agentplattformer ikke lenger kan basere sikkerhet på at slitne mennesker klikker «allow» 200 ganger om dagen. De som vinner, bygger intent-sjekk, hard denies og audit inn i runtime – og styrer det som en del av SDLC og leverandørstyring.

Kilder og medier

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.