Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

OpenAI lover teknisk rapport etter Hugging Face-hendelse • Anthropic gjør Claude Opus 5 til ny toppmodell for agentarbeid • Falske AI-plugins stjal utviklernes API-nøkler • AI-agentpakker på npm ble kapret i 27 minutter • Beijing tvinger Meta til å reversere Manus-kjøp

Artificial Analysis: Claude Opus 5 tar ledelsen på agentbenchmark

JH
Joachim Høgby
26. juli 202626. juli 20265 min lesingKilde: Artificial Analysis

Anthropic fikk allerede oppmerksomheten med Claude Opus 5. Det interessante nå er den første eksterne målingen av hva modellen faktisk gjør i mer realistisk kunnskapsarbeid. Artificial Analysis sier at Opus 5 går til topps på AA-Briefcase, deres benchmark for agentiske arbeidsoppgaver med rapporter, presentasjoner, regneark og mange private inputfiler.

Kortversjonen: dette er en sterk bekreftelse på at frontier-modeller ikke bare blir bedre på enkeltspørsmål. De blir bedre på sammensatt arbeid der kvaliteten ligger i analyse, prioritering, bruk av verktøy og evnen til å levere et ferdig arbeidsprodukt. For CIO-er og CISO-er er det mer relevant enn enda en generell chat-score.

Artificial Analysis oppgir at Claude Opus 5 på maksimal innsats får 1720 Elo på AA-Briefcase. Det er 146 Elo foran Claude Fable 5 i samme sammenligning, som ligger på 1574. De høyere innsatsnivåene til Opus 5 tar også de øverste plassene. På GDPval-AA v2 peker samme testmiljø på 1861 Elo for Opus 5 max, 114 Elo foran Fable 5. Det gjør lanseringen mindre til en ren modellnyhet og mer til et signal om hvordan agentarbeid bør måles i virksomheter.

Hvorfor dette betyr noe

Mange virksomheter tester AI med for enkle oppgaver. De spør modellen, får et svar og diskuterer om svaret virker smart. Det er ikke slik arbeidsflyter i ledelse, teknologi, økonomi, sikkerhet eller drift faktisk ser ut. Reelle oppgaver krever at modellen leser mange kilder, tar valg underveis, lager et output som andre kan bruke, og tåler at kvaliteten blir vurdert på flere dimensjoner samtidig.

AA-Briefcase er interessant nettopp fordi den prøver å fange denne typen arbeid. Den måler ikke bare om modellen finner et riktig svar. Den vurderer blant annet rubrikkoppfyllelse, analytisk kvalitet og presentasjonskvalitet. Ifølge Artificial Analysis drives Opus 5-forbedringen særlig av bedre rubrikkpassering og høyere analytisk kvalitet. Presentasjon forbedres, men er ikke like dominerende. Det er et kjent mønster for AI i virksomheter: analysen kan bli bedre før leveransen blir helt robust som sluttprodukt.

For en leder betyr det at Opus 5 kan være mer nyttig som analytisk motor enn som uovervåket rapportfabrikk. Den kan sannsynligvis gjøre tyngre forarbeid, sammenligne flere alternativer og rydde i store informasjonsmengder. Men virksomheten må fortsatt ha kontroll på bestilling, datagrunnlag, kvalitetssikring og hvem som eier konklusjonen.

Prisen er ikke bare tokenpris

Det mest praktiske tallet i testen er ikke bare Elo. Det er tid og innsats. Artificial Analysis peker på at de høyeste innsatsnivåene kan bruke mer enn 25 minutter per oppgave i snitt. Maksnivået ligger rundt 36 minutter og over 100 agentturns. Det kan være riktig for tunge analyser, men det er feil design for alt som skal inn i raske, repeterbare produksjonsløp.

Dette er en viktig korreksjon til enkel AI-økonomi. Når modeller får flere innsatsnivåer, blir kostnaden en styringsbeslutning. Lav innsats kan være nok for utkast, klassifisering og enkel analyse. Høy innsats kan forsvares for styrenotater, leverandørvalg, revisjonsarbeid, hendelsesanalyse og kodeendringer med høy risiko. Maks innsats bør reserveres for saker der kvaliteten er mer verdt enn ventetid og forbruk.

Artificial Analysis oppgir samtidig at Opus 5 high kan slå Fable 5 med 32 Elo til under halv kostnad per oppgave i deres oppsett. Det er mer interessant enn en toppscore. Hvis det holder i produksjon, betyr det at virksomheter ikke alltid må velge dyreste modus for å få et merkbart bedre resultat. Riktig policy kan bli viktigere enn én standardmodell.

CIO- og CISO-vinkelen

For CIO er dette et argument for å måle AI på arbeidsflyter, ikke bare modellnavn. En god pilot bør ha konkrete oppgaver, realistiske dokumentmengder, tydelige kriterier og kost per godkjent leveranse. Det er slik man ser om en modell faktisk flytter tid fra mennesker til maskin, eller bare lager mer kontrollarbeid.

For CISO er læringen litt hardere. Agentiske modeller som bruker mange steg og verktøy gir større angrepsflate enn en enkel chatbot. Flere filer, flere handlinger og lengre kontekst gjør prompt injection, datalekkasje, verktøymisbruk og feilaktige mellomkonklusjoner mer relevante. Anthropic framhever selv bedre sikkerhet og alignment i Opus 5, men benchmark-resultater endrer ikke behovet for logging, dataklassifisering, tilgangsstyring og menneskelig godkjenning på høy-risiko-handlinger.

Det riktige spørsmålet er derfor ikke om Opus 5 er «best». Det riktige spørsmålet er hvilke arbeidsoppgaver den får lov til å utføre, med hvilke verktøy, på hvilke data og med hvilken grad av etterkontroll. Der ligger forskjellen mellom produktivitetsløft og en dyr agentpilot som ingen tør å sette i drift.

Hva bør virksomheter gjøre nå?

Første steg er å bygge et lite internt evalsett. Velg 20 til 50 oppgaver som faktisk finnes i virksomheten: sikkerhetsvurderinger, anskaffelsesnotater, kodegjennomgang, avviksanalyse, kontraktssammenligning eller driftsrapportering. Kjør samme oppgaver med ulike innsatsnivåer. Mål kvalitet, ventetid, kost, feiltype og hvor mye menneskelig retting som gjenstår.

Andre steg er å skille mellom analysemodus og produksjonsmodus. En modell kan være glimrende til å lage beslutningsgrunnlag, men fortsatt trenge en annen flyt for publisering, kodeendring eller sikkerhetstiltak. Det er særlig viktig når agenten kan lese store mengder data og gjøre mange mellomvalg.

Tredje steg er å lage en enkel policy for innsatsnivå. Ikke la brukerne selv velge «max» fordi det høres best ut. Bruk lavere innsats på raske oppgaver, høyere innsats på komplekse saker, og krev begrunnelse når en oppgave skal bruke lange agentløp. Da blir AI-budsjettet styrt som kapasitet, ikke som magi.

Min vurdering: Artificial Analysis-resultatene gjør Claude Opus 5 mer interessant enn den rene lanseringen gjorde. Ikke fordi én benchmark avgjør markedet, men fordi den peker mot riktig evaltype. Fremover blir konkurransen mindre om hvem som svarer smartest i chat, og mer om hvem som leverer pålitelige arbeidsprodukter til en kost og risiko virksomheten faktisk kan styre.

Kilder og medier

Primærkilde: Artificial Analysis – https://x.com/ArtificialAnlys/status/2080777718933995967

Bakgrunn: Anthropic – https://www.anthropic.com/news/claude-opus-5

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.