Claude Sonnet 5.5: 2/10 dollar – 30 prosent raskere, cyber-fallback
Anthropic slipper Claude Sonnet 5.5 28. september, andre modell i 5.5-familien etter Opus 5.5 forrige uke. Listen er den samme som Sonnet 5: 2 dollar per million input-tokens, 10 dollar per million output-tokens og 0,20 dollar for cache-les. Laben sier modellen er over 30 prosent raskere og koster inntil 30 prosent mindre per oppgave fordi den bruker færre tokens. For CIO er dette arbeidshesten. For CISO er det første Sonnet med cyber-sperrer på Opus-nivå.
Haiku 5.5, billigvarianten for høyt volum, kommer «i ukene som kommer». Ingen dato.
Hva som faktisk skippes
Modell-ID er claude-sonnet-5-5 på Claude API, Google Cloud, Microsoft Foundry og Claude Platform on AWS. På Amazon Bedrock heter den anthropic.claude-sonnet-5-5. Kontekstvindu 1 million tokens, maks 128 000 output synkront, 300 000 i Batch API med beta-header. Kunnskapskutt juni 2026. Tenking er adaptiv. Standard effort er high på Claude API; i Claude-appene er Medium default.
Null dataretensjon gjelder, som for Opus 5.5 og Sonnet 5. Anthropic sier den er tilgjengelig på alle plattformer, inkludert AWS, Google Cloud og Microsoft Azure.
Sonnet 5.5 er posisjonert mot avgrensede hverdagsoppgaver: feilretting, dokumenter, lysbilder og regneark. Opus 5.5 beholdes for åpent arbeid som krever vedvarende skjønn. Anthropic er tydelig på at benchmark-poeng ikke endrer det skillet, selv når Sonnet ved Max effort nærmer seg Opus på enkelte tester.
Migrering fra Sonnet 5 er ikke drop-in. Docs lister fem brudd: between_tools må brukes for å slå av tenking foran verktøykall; tvungen tool use gir feil; thinking-blokker er bundet til modell og samtale; computer_20251124 avvises på Claude API og Google Cloud; advisor-verktøyet avviser Opus 4.8, Opus 4.7 og Sonnet 5 som rådgivere. Tekst mellom verktøykall kommer i thinking-blokker. En strøm som viser den teksten til brukeren blir stille inntil display settes, eller tenking slås av med between_tools.
Tallene, med forbehold
Alle hovedtall under er Anthropics egne, med fotnoter. Independent Artificial Analysis kjørte GDPval-AA og AA-Briefcase på en pre-release med en feil i strukturert output som laben sier er rettet og som i så fall underdriver Sonnet 5.5. GPT-6 Sol mangler offentlig Terminal-Bench 4.0 og CursorBench 4.0; der viser Anthropic GPT-5.6 Sol i stedet.
Terminal-Bench 4.0, agentisk koding i terminal: Sonnet 5.5 70,6 prosent, Sonnet 5 10,3 prosent, Opus 5.5 66,4 prosent ved Xhigh. CursorBench 4.0, tvetydige flerfiloppgaver fra ekte Cursor-sesjoner: 55,5 mot 34,1 og 57,8. FrontierCode 1.1 (Main), om en endring kan merges: 46,2 prosent ved Max, 52,1 ved Xhigh, mot Sonnet 5 42,4, Opus 54,4 og GPT-6 Sol 49,3. Sonnet scorer lavere ved Max enn Xhigh fordi code-review-skillen splitter arbeidet på subagenter og i to tilfeller ga timeout eller endringer utenfor scope.
GDPval-AA v2.1: 1844 mot Sonnet 5 1449, Opus 1846 og GPT-6 Sol 1487. AA-Briefcase v1.1: 1811 mot 1359, 1822 og 1483. Humanity’s Last Exam med verktøy: 64,5 mot 54,9 og 67,7. OSWorld 2.1 partial: 80,1 mot 57,0 og 81,8. Chartography uten verktøy: 61,6 mot 15,6, 64,4 og 53,6.
Kostnadskurvene er poenget for innkjøp. Ved Low eller Medium slår Sonnet 5.5 Sonnet 5s beste score for om lag en tiendedel av kostnaden per oppgave, ifølge laben. Ved High på FrontierCode matcher den GPT-6 Sols beste score for om lag en femtedel av kostnaden. Effort er spaken: høyere effort gir lengre arbeid, høyere score og høyere regning.
Testersitater på lanseringssiden er ikke uavhengige evalueringer. CodeRabbit vil flytte enkle og moderate reviews nå. Slack rapporterer bedre Slackbot-eval uten prompt-endring, færre steg og om lag 14 prosent færre output-tokens. Zendesk sier 20 prosent raskere saksbehandling i interne tester. Balyasny målte 121 000 tokens per svar mot 497 000 på Sonnet 5 i 2 441 finansoppgaver. Base44: 3,6 iterasjoner per app mot Opus 5s 7,7 over 118 bygg. Unity sier 90 prosent av oppgavene i sin Editor- og kodebenchmark gikk gjennom runtime-sjekk. Ta det som tidlige produksjonssignaler, ikke som SLA.
CISO: cyber opp, fallback ned til Sonnet 5
Systemkortet 28. september er kortere enn for frontier-modeller. Anthropic skriver at Sonnet 5.5 ikke krysser nye terskler i Responsible Scaling Policy og er bredt mindre kapabel enn Opus 5.5. Misalignment-risiko vurderes som lav når resonneringen er synlig.
Cyber er unntaket som styrer produktet. Laben sier Sonnet 5.5s cyber-evner er et stort hopp fra Sonnet 5 og sammenlignbare med Opus 5, uten å nå Opus 5.5 eller Mythos 5.1. Derfor er det første Sonnet med trelags cyber-safeguards som på Opus 5.5. Rutineutvikling og feilretting i egen kode skal gå. Høyrisiko cyber-oppgaver faller synlig tilbake til Sonnet 5. Cyber Verification Program skal gi forsvarere trinnvis tilgang til mer avanserte evner på Sonnet 5.5, Opus 5.5 og Mythos. Ingen åpen dato for søknad.
Biologi-sperrene er de samme som på Sonnet 5. De treffer skadelige forespørsler; det meste av forskning, utdanning og klinikk skal være upåvirket, men mikrobiologi og virologi kan flagges feil. Life Sciences Verification Program finnes for bredere tilgang.
Destillasjon er nytt på Sonnet-nivå. Anthropic ruller ut klassifiserere mot reasoning-ekstraksjon, fordi angripere med tusenvis av falske kontoer kan destillere evner uten labens sperrer. Preserved thinking utvides: tenking kan ikke løsrives fra kontoen som skapte den. De fleste merker ingenting. De som flytter samtaler mellom kontoer, inkludert bytte midt i en Claude Code-sesjon, må lese migreringsdokumentet før kuttet treffer.
Alignment-audit over om lag 1 850 scenarier: Sonnet 5.5 matcher eller slår Sonnet 5 på de fleste mål for alignment, misbruksmotstand og ærlighet. Lavest tilbøyelighet blant testede modeller til usanksjonert sandkasseflukt og grenseprobing. Tenkingen er mer uleselig enn hos mange tidligere modeller. Agentic safety: mest robuste Sonnet mot prompt injection i koding og nettleser, men refusals på skadelige computer-use-oppgaver er på Opus 5.5-nivå og en regresjon mot enkelte eldre modeller. Multi-turn testing viser regresjoner på tracking og overvåking, bedring på politisk likebehandling.
Ingen evalueringspakke fanger alt. Anthropic sier det selv.
Hva ledergruppen bør gjøre nå
Sett Sonnet 5.5 som default for avgrenset koding, dokumenter og agentløkker der kostnad per oppgave styrer, ikke som erstatning for Opus 5.5 på åpent skjønn. Mål tokens per ferdig oppgave, ikke listpris. Effort Low/Medium er der laben hevder ti-til-én mot Sonnet 5; High/Xhigh spiser fordelen.
Kartlegg thinking: off. Uten between_tools feiler flyten. Kartlegg computer-use-verktøyversjon og advisor-par. Test at strømmede svar mellom verktøykall ikke forsvinner inn i thinking-blokker.
CISO: anta at Sonnet 5.5 kan mer på exploit-siden enn Sonnet 5, og at fallback til Sonnet 5 er synlig for brukeren. Det er et kontrollpunkt, ikke et tak. Verifiseringsprogrammene for cyber og life science er søknadsbaserte. Destillasjonssperrer og preserved thinking endrer kontohygiene i Claude Code. Null dataretensjon er avtale, ikke arkitekturbevis.
Ikke vent på Haiku 5.5 for å ta stilling til Sonnet. Den er varslet, ikke priset.
Kilder og medier
Primærkilde: Anthropic, «Introducing Claude Sonnet 5.5», 28. september 2026. https://www.anthropic.com/claude-sonnet-5-5
Systemkort: Anthropic, «System Card: Claude Sonnet 5.5», 28. september 2026.
Modelldokumentasjon og migreringsguide: Claude Docs, Claude Sonnet 5.5 overview.
Bekreftet i top-tier media: TechCrunch, «Anthropic releases Sonnet 5.5, which it calls a significantly cheaper, faster work partner», 28. september 2026.
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.