AA: Sonnet 5.5 på 68 i kodeagenter – 14 dollar mot Sols 1
Artificial Analysis oppdaterer 2. oktober Coding Agent Index. Claude Code med Sonnet 5.5 ved max ligger øverst med 68. Regningen er 14,19 dollar per oppgave, høyest på listen. Codex med GPT-6.1 Sol ved xhigh tar 63 til 1,04 dollar. Gemini 4 Argon i Antigravity CLI scorer 64 til 5,84 dollar, med Googles lanseringsrabatt. Argon er merket utilgjengelig. Ikke allment sluppet.
Poenget for CIO er at raden er modell pluss harness pluss effort, ikke en modell. For FinOps er det at 68 koster 14 ganger Sols 63 når du betaler per token.
68 mot 63, og 14 dollar mot 1
Indeksen er v1.5. Lik vekt på DeepSWE v1.1 (113 repo-oppgaver), Terminal-Bench 4.0 (66 terminaloppgaver) og SWE-Atlas-QnA (124 spørsmål i kodebase). 303 oppgaver. Tre forsøk. pass@1. Kostnaden er API per token, inkludert cache, ikke Claude- eller ChatGPT-abonnement.
Sonnet 5.5 max i Claude Code: 68. DeepSWE 72. Terminal-Bench 66. SWE-Atlas 67. 87 minutter veggtid. 27,7 millioner tokens per oppgave. 601 000 ut-tokens.
Opus 5.5 max i samme harness: 66 til 13,04 dollar. 64 minutter. Dyrere enn Sol, billigere enn Sonnet, bak begge på toppen.
Argon high i Antigravity CLI: 64. DeepSWE 79, best på listen. Terminal-Bench 56. SWE-Atlas 57. 35 minutter. 5,84 dollar med kampanjepris. AA skriver at Argon ikke er offentlig ennå.
Sol xhigh i Codex: 63. DeepSWE 73, foran Sonnet. Terminal-Bench 55. SWE-Atlas 61. 16 minutter. 1,04 dollar. En sjettedel av Argon. En fjortendedel av Sonnet.
Deretter Fable 5.1 max i Claude Code med fallback, 62 til 12,39 dollar. Devin Fusion med Fable 5.1, 62 til 7,90. GPT-6 Astra max i Codex, 62 til 7,47. Grok 4.7 i Grok Build, 56 til 8,82, med 33 på Terminal-Bench. Muse Spark 1.3, 54 til 3,98. GLM-5.3 i Opencode, 54 til 4,24. Kimi K3, 52 til 5,05.
Hva som faktisk måles
DeepSWE krever patch i eksisterende repo, isolert uten nett, verifisert i egen sandkasse. Der leder Argon. Sol slår Sonnet.
Terminal-Bench 4.0 er skjell, verktøy og flertrinns drift. Der tar Sonnet 66 mot Argons 56 og Sols 55. Grok og Muse faller til 33 og 32.
SWE-Atlas-QnA er åpne svar i kodebase, dømt av Claude Opus 4.5 etter Scale AIs Task Resolve Rate. Sonnet 67. Opus 66. Sol 61. Argon 57.
AA advarer: to agenter med samme indekstall kan være ulike på patch versus terminal. Ikke kjøp 68 uten å se deltestene.
Refusals og tid
Safety refusals telles. Sonnet 5.5: 4,5 prosent. Opus 5.5: 8,9 prosent, om lag dobbelt. AA skrev 1. oktober at rundt 94 prosent av Sonnets nei kom etter første tur, og at agenten da nesten alltid byttet til Opus 4.8. Argon, Grok, Muse, GLM og Kimi: 0 i denne kjøringen. Atferden er leverandørstyrt og kan endres.
Sonnet bruker 266 steg og 87 minutter. Sol 40 steg og 16 minutter. Det er ikke bare tokenpris. Det er også hvor lenge en agent sitter i en sandbox du betaler for.
Hva ledelsen bør gjøre
Be om harness, effort og API-kost per oppgave, ikke modellnavn. Hvis teamet lever i Claude Code, er 68 reelt, og 14 dollar per oppgave er også reelt når fakturaen er token. Hvis teamet lever i Codex, er 63 til 1,04 dollar den raden som styrer budsjettet. Argon slår begge på DeepSWE, men er ikke allment tilgjengelig, og 5,84 dollar sitter i kampanjepris.
Abonnement kan skjule tokenregningen. AA måler den. Bland ikke de to.
Kilder og medier
Primærkilde: Artificial Analysis, Coding Agent Index, 2. oktober 2026. https://artificialanalysis.ai/agents/coding-agents Metodikk: https://artificialanalysis.ai/methodology/coding-agents-benchmarking Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.