Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

OpenAI lover teknisk rapport etter Hugging Face-hendelse • Anthropic gjør Claude Opus 5 til ny toppmodell for agentarbeid • Falske AI-plugins stjal utviklernes API-nøkler • AI-agentpakker på npm ble kapret i 27 minutter • Beijing tvinger Meta til å reversere Manus-kjøp

Anthropic gjør Claude Opus 5 til ny toppmodell for agentarbeid
Breaking
AI-modellerAnthropicClaudeKodeagenterCIOSikkerhet

Anthropic gjør Claude Opus 5 til ny toppmodell for agentarbeid

JH
Joachim Høgby
24. juli 202624. juli 20265 min lesingKilde: Anthropic

Anthropic har lansert Claude Opus 5 som ny toppmodell i Opus-linjen. Den korte versjonen: dette er ikke bare en ny modell med høyere benchmark-tall. Anthropic posisjonerer Opus 5 som en mer praktisk arbeidshest for lange kode- og kunnskapsoppgaver, med bedre ytelse per krone, tydeligere sikkerhetsrammer og en raskere modus for produksjonsbruk.

Det viktigste for ledere er at Opus 5 skyver frontier-modeller nærmere normal drift. Anthropic sier modellen er tilgjengelig nå i betalte Claude-planer og i API-et. Den blir standardmodell i Claude Max og sterkeste valg i Claude Pro. På API prises den til 5 dollar per million input-tokens og 25 dollar per million output-tokens, samme nivå som Opus 4.8. Fast mode skal kjøre rundt 2,5 ganger raskere enn standardmodus, men til høyere pris.

Det gjør lanseringen relevant for CIO-er av tre grunner. Først: agentarbeid blir mer målbart. Når samme modell kan kjøres med ulike innsatsnivåer, blir kost per løst oppgave viktigere enn rå modellrangering. For det andre: utviklerverktøy får mer rom til å velge mellom fart, kvalitet og tokenbudsjett uten å bytte leverandør. For det tredje: sikkerhet og styring blir en del av modellvalget, ikke noe man kan rydde opp i etterpå.

Anthropic hevder at Opus 5 setter ny toppscore på flere kode- og kunnskapsarbeids-evalueringer, blant annet Frontier-Bench og GDPval-AA. Selskapet trekker særlig frem programvareoppgaver der Opus 5 skal slå andre modeller og mer enn doble Opus 4.8 på Frontier-Bench v0.1 til lavere kost per oppgave. På CursorBench 3.2 sier Anthropic at modellen på maks innsats ligger innenfor 0,5 prosent av Claude Fable 5s toppscore, men til omtrent halv kost per oppgave.

Det er markedsføring, men det er også en tydelig produktretning: toppmodellene blir ikke bare større. De pakkes for agentiske arbeidsflyter der modellen må planlegge, skrive, teste, revidere og holde kontekst over tid. For norske virksomheter betyr det at neste runde med AI-budsjetter bør handle mindre om «hvilken chatbot er smartest?» og mer om «hvilke oppgavetyper tåler autonomi, hvilke krever menneskelig kontroll, og hva koster en ferdig leveranse?».

Sikkerhetsdelen er kanskje den mest interessante. Anthropic sier Opus 5 er deres mest aligned modell hittil i en automatisert adferdsrevisjon, med lavere forekomst av villedende adferd og risikable handlinger enn nyere Claude-modeller. Samtidig sier selskapet eksplisitt at Opus 5 ikke flytter fronten for risikable dual-use-kapasiteter. Den skal fortsatt ligge bak Mythos 5 på biologisk forskning og offensiv cybersikkerhet.

Det er et viktig signal. Leverandørene prøver nå å selge både kapasitet og begrensning samtidig. For en CISO er det ikke nok at en modell er bedre på å finne sårbarheter. Man må også vite hvordan leverandøren håndterer grensen mellom defensiv feilsøking og offensiv utnyttelse. Anthropic beskriver et oppsett der utviklere skal få hjelp til å identifisere og rette svakheter, mens høy-risiko bruk skal blokkeres eller rutes annerledes.

Lanseringen kommer også med to API-endringer i beta. Den ene lar utviklere endre tilgjengelige verktøy midt i en samtale uten å ødelegge prompt-cache. Den andre er automatiske fallbacks, der forespørsler som flagges av sikkerhetsklassifisering på Opus 5 eller Fable 5 kan rutes til en annen modell i stedet for å stoppe helt. Det høres teknisk ut, men er praktisk viktig: stabile agentløp krever at sikkerhetskontroller ikke bare blir røde stopplys. De må kunne håndtere avvik uten at hele arbeidsflyten kollapser.

For innkjøp og arkitektur gir Opus 5 fire konkrete vurderingspunkter.

  • Mål oppgavekost, ikke tokenpris alene. Hvis en dyrere modell løser flere oppgaver uten manuell omstart, kan den være billigere i praksis.

  • Test på egne kodebaser og dokumentløp. Benchmarks er nyttige, men de sier lite om deres integrasjoner, tilgangsstyring, gamle systemer og krav til sporbarhet.

  • Skill mellom agentarbeid og assistentarbeid. En modell som er god til å svare, er ikke automatisk god til å gjøre arbeid over tid med verktøy, filer og delmål.

  • Krev forklaring på fallback, logging og misbruksgrenser. Når modeller får mer ansvar i utvikling og sikkerhet, blir styringslaget like viktig som modellkortet.

Det er også verdt å merke seg at Anthropic ikke presenterer Opus 5 som en ren erstatning for alt annet. Fable 5 omtales fortsatt som intelligensfronten, mens Mythos 5 beskrives som sterkere på visse bio- og cybersikkerhetsoppgaver. Opus 5 er snarere forsøket på å gjøre toppnivået mer brukbart i hverdagen: raskere, billigere per oppgave og tryggere å slippe inn i reelle arbeidsflyter.

Den strategiske konsekvensen er enkel: modellmarkedet går fra «best modell» til porteføljestyring. Én modell for lange kodeagenter, én for lavlatens, én for sikkerhetsfølsomme oppgaver, én for billige masseoperasjoner. Anthropic vil med Opus 5 eie den delen av porteføljen der arbeid faktisk skal fullføres, ikke bare svares på.

For CIO-er er neste steg ikke å bytte alt til Opus 5 i morgen. Det smarte er å kjøre en kontrollert eval på tre til fem reelle arbeidsflyter: kodeendring med tester, dokumentanalyse med krav til kildebelegg, sikkerhetsgjennomgang av pull requests, intern supportautomatisering og et langvarig agentløp med kosttak. Mål kvalitet, tid, manuell inngripen, feilmodus og totalkost. Da finner man fort ut om dette er en premium-assistent eller en faktisk produksjonskomponent.

Opus 5 ser ut som en sterk lansering fordi den angriper akkurat der virksomheter kjenner friksjonen: agentene er lovende, men dyre, trege og vanskelige å styre. Hvis Anthropic leverer på kombinasjonen av kvalitet, fart og sikkerhetskontroll, blir dette en modell norske teknologiledere bør teste seriøst. Ikke fordi den er ny. Fordi den kan gjøre autonomt AI-arbeid lettere å budsjettere, kontrollere og forsvare.

Kilder og medier

Primærkilde: Anthropic, «Introducing Claude Opus 5» - https://www.anthropic.com/news/claude-opus-5 Offisiell X-annonsering: https://x.com/claudeai/status/2080699495453528290 Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.