Agent Arena: Fable 5.1 leder – Astra er ikke målt ennå
Arena.ai satte 6. september Claude Fable 5.1 Max øverst i Agent Arena. Net improvement er 15,87 prosent pluss/minus 2,84 over 6 796 økter. Det er den første store, menneskestemte agentrangeringen etter Fable 5.1-lanseringen 1. september. GPT-6 Astra, som leder Code Arena WebDev, er ikke rangert her ennå.
For CIO og CISO er poenget ikke at Anthropic «vant agenter». Utvalget er tynt. Fable 5.1 Max har 6 796 økter. Claude Opus 5 High har 22 594. GPT-5.6 Sol xHigh har 29 730. Kimi K3 Max har 97 915. Mediankost for Fable 5.1 Max er 4,24 dollar per oppgave. Det er den dyreste toppen på tavlen. Styrbarhet er nær null.
Hva Arena faktisk måler
Agent Arena rangerer modeller på lange, reelle agentoppgaver med nettsøk, filsystem og terminal. Snapshotet på live-tavlen er merket 5. september 2026: 2 285 256 økter, 59 modeller, 16 laber. Live-tavlen ligger på arena.ai/leaderboard/agent. Arena bruker kausal sporing av net improvement mot gjennomsnittsmodellen, ikke Elo alene.
Fable 5.1 Max er merket proprietær, 10 dollar inn og 50 dollar ut per million tokens. Den leder to signaler: bekreftet suksess 22,45 prosent pluss/minus 3,71, og ros mot klage 42,45 prosent pluss/minus 10,94. Bash-gjenoppretting er 13,11 prosent, fjerdeplass. Verktøyhallusinering er 0,78 prosent, i bunnsjiktet sammen med flere andre. Styrbarhet er 0,58 prosent pluss/minus 6,77. Konfidensintervallet spenner over null. Det er ikke et styringssignal dere kan stole på.
Claude Opus 5 High ligger toer med 12,68 prosent net improvement, 5/25-prising og 2,42 dollar per oppgave. Opus 5 Max er treer med 11,67 prosent og 3,72 dollar per oppgave. Fable 5 High er firer. De fire øverste er Anthropic. Deretter kommer GPT-5.6 Sol xHigh på 9,31 prosent og 1,19 dollar per oppgave.
Kimi K3 Max er sjuer med 7,96 prosent og 0,80 dollar per oppgave, men med desidert flest økter. Tencent Hy4 preview, Apache 2.0, ligger rundt 6,9 prosent og 0,26 dollar. Gemini 3.8 Flash High ligger på 5,47 prosent og 0,22 dollar. Det er pris-ytelse, ikke toppkvalitet.
Tallene som bør inn i innkjøpsnotatet
Fable 5.1 Max: 15,87 prosent net improvement, 6 796 økter, 4,24 dollar per oppgave, 52 600 output-tokens median, listpris 10/50.
Opus 5 High: 12,68 prosent, 22 594 økter, 2,42 dollar, 5/25.
Opus 5 Max: 11,67 prosent, 18 112 økter, 3,72 dollar, 5/25.
GPT-5.6 Sol xHigh: 9,31 prosent, 29 730 økter, 1,19 dollar, 4/20.
Kimi K3 Max: 7,96 prosent, 97 915 økter, 0,80 dollar, 3/15.
Gemini 3.8 Flash High: 5,47 prosent, 10 104 økter, 0,22 dollar, 0,75/3,75.
Nedre kant for Fable 5.1 Max er om lag 13 prosent. Øvre kant for Opus 5 High er om lag 14,4 prosent. Intervallene møtes ikke like tett som i Code Arena WebDev, men utvalget er skjevt. Fable 5.1 har færre økter enn de nærmeste konkurrentene. Arena selv viser at Astra-spor fortsatt samles. Ikke les inn en OpenAI-seier eller et OpenAI-nederlag som ikke er målt.
Code Arena WebDev 5. september ga Astra Max 1797 og Fable 5.1 Max 1762, med overlapping intervall. Artificial Analysis Intelligence Index v4.2 4. september gir Fable 5.1 samlet forrang. Agent Arena svarer på et tredje spørsmål: lange verktøyløp med filer, skall og nett. Tre tavler, tre svar. Ikke la én overstyre de andre.
Hva dette betyr for innkjøp
Ikke bytt default-agent på 6 796 økter og 4,24 dollar median. Behold Fable 5.1 Max og Opus 5 High som parallell A/B på de oppgavene dere faktisk betaler for: kodeagenter, research-løp, dokumentflyter. Opus 5 High er nærmeste volummodell med bedre styrbarhet og halve oppgavekostnaden.
Listpris 10/50 er identisk med Astra. Kostnad per ferdig oppgave er det som betyr noe. Fable 5.1 Max spiser 52 600 output-tokens median. Sol gjør jobben billigere og dårligere. Gemini 3.8 Flash og Hy4 er FinOps-alternativer, ikke ledermodeller. Preliminary og lavt øktantall gjelder også her. Ikke lås en Kina-modell inn i produksjon på ett snapshot.
CISO: Agent Arena er web, filsystem og terminal. Det er en annen angrepsflate enn chat. Fable 5.1 har svak styrbarhet i dette utvalget. Hold agenttilgang bak policy, logging og menneskelig godkjenning av handlinger som skriver, deployer eller betaler. En offentlig tavle endrer ikke det.
Oppdater notatet når Astra får rang, når Fable 5.1 passerer vesentlig mer enn 7 000 økter, og når styrbarhetsintervallet ikke lenger krysser null. Frem til da: Anthropic eier toppen, prisen per oppgave er høy, og den dyreste modellen er minst styrbar.
Kilder og medier
Primærkilde: Arena.ai, Agent Arena-ledertavle, snapshot 5.–6. september 2026: https://arena.ai/leaderboard/agent
Offisiell Arena-kunngjøring på X: https://x.com/arena/status/2096403705231008160
Arena, Agent Arena-metodikk: https://arena.ai/blog/agent-arena-methodology/
Code Arena WebDev (sammenligning, 5. september): https://arena.ai/leaderboard/code/webdev
Artificial Analysis Intelligence Index v4.2 (sammenligning, 4. september): https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-2
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.