Code Arena: Astra leder WebDev – Fable 5.1 innenfor spredningen
Arena.ai oppdaterte Code Arena WebDev 5. september. OpenAIs GPT-6 Astra Max ligger først med 1797 poeng. Anthropics Claude Fable 5.1 Max følger på 1762. Det er den første store, menneskestemte webutviklings-rangeringen etter Astra-lanseringen 3. september.
For CIO og CISO er poenget ikke at OpenAI «vant koding». Rang-spredningen for begge er 1–2. Konfidensintervallene overlapper. Astra har 1 199 stemmer mot Fables 2 275. Dette er et tidlig signal på frontend-agenter, ikke en SLA dere kan fryse i arkitekturdokumentet.
Hva Arena faktisk måler
Code Arena WebDev rangerer modeller på front-end webutvikling, inkludert agentiske løp med flere steg og verktøybruk. Snapshotet 5. september viser 650 961 stemmer, 126 modeller og 20 laber. Live-tavlen ligger på arena.ai/leaderboard/code/webdev.
Arena merker gpt-6-astra-max som proprietær, med 1,1 million tokens kontekst og listpris 10 dollar inn og 50 dollar ut per million tokens. Fable 5.1 Max har samme listpris og 1 million tokens. Claude Opus 5 Max ligger treer på 1688 med 5/25-prising og over 10 000 stemmer.
Qwen 3.8-Max-0902 ligger fireer på 1686, merket preliminary, til 2/6. Kimi K3 Max er femmer på 1674. GPT-5.6 Sol xHigh i Codex-harness er nede på 13. plass med 1617. Hoppet fra Sol til Astra på denne tavlen er stort. Det er også smalt: det er WebDev, ikke Terminal-Bench, ikke Artificial Analysis Intelligence Index.
På lab-tavlen er rekkefølgen OpenAI, Anthropic, Alibaba, Moonshot, deretter SpaceXAI Grok 4.6 High og Meta Muse Spark 1.3 xHigh. De to siste ligger rundt 1625 og 1622. De er relevante for innkjøp, men de er ikke i kampen om førsteplassen.
Tallene som bør inn i innkjøpsnotatet
Astra Max: 1797, pluss/minus 24, 1 199 stemmer, rang-spredning 1–2.
Fable 5.1 Max: 1762, pluss/minus 16, 2 275 stemmer, rang-spredning 1–2.
Opus 5 Max: 1688, pluss/minus 8, 10 904 stemmer, 5 dollar inn og 25 dollar ut.
Qwen 3.8-Max-0902: 1686, preliminary, 2/6. Kimi K3 Max: 1674, 3/15.
Nedre kant for Astra er 1773. Øvre kant for Fable 5.1 er 1778. Intervallene møtes. Arena selv viser spredning 1–2 for begge. En 35-poengs ledelse med ulikt stemmetall er ikke det samme som et byttevedtak.
Artificial Analysis Intelligence Index v4.2, publisert 4. september, gir fortsatt Fable 5.1 forrang samlet. Astra er toer der, med fire poeng over GPT-5.6 Sol. Code Arena og AA Index svarer på ulike spørsmål. Den første er menneskestemt webutvikling. Den andre er en sammensatt indeks med mer privat testdata. Ikke la én tavle overstyre den andre.
Astra er allerede i GitHub Copilot for Pro+, Max, Business og Enterprise, med gradvis utrulling og modellpolicy for admin. Det er produktkanal. Det er ikke bevis for at WebDev-Elo er overført til deres repo.
Hva dette betyr for innkjøp
Ikke bytt default-modell på bakgrunn av 35 Elo og overlapping intervall. Behold Fable 5.1 og Astra som parallell A/B på de samme internoppgavene: intern webutvikling, agentiske UI-løp, og de oppgavene dere faktisk betaler for.
Pris per million tokens er identisk på toppen. Kostnad per ferdig oppgave er det som betyr noe. Arena viser at Qwen og Kimi ligger tett bak Opus til lavere listpris. Det er et FinOps-spørsmål, ikke et lab-lojalitetsspørsmål. Preliminary-merket på Qwen 3.8-Max-0902 betyr at tallet kan flytte seg. Ikke lås en Kina-modell inn i produksjon på ett snapshot.
CISO: Astra er allerede klassifisert som Critical på cybersikkerhet hos OpenAI, med styrt cybertilgang. WebDev-agenter med nettleser og verktøy er en annen angrepsflate enn chat. Hold agenttilgang bak policy, logging og menneskelig godkjenning av deploy. Elo på en offentlig tavle endrer ikke det.
Stemmetallene vil bevege tavlen. Fable har nesten dobbelt så mange WebDev-stemmer. Oppdater notatet når spredningen ikke lenger er 1–2, og når Qwen-tallet ikke lenger er preliminary. Frem til da: to leverandører på toppen, samme listpris, ulik evidens.
Kilder og medier
Primærkilde: Arena.ai, Code Arena WebDev-ledertavle, snapshot 5. september 2026: https://arena.ai/leaderboard/code/webdev
Offisiell Arena-kunngjøring på X: https://x.com/arena/status/2096290434700247250
Artificial Analysis Intelligence Index v4.2 (sammenligning, 4. september): https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-2
GitHub Changelog, GPT-6 Astra i Copilot, 4. september 2026: https://github.blog/changelog/2026-09-04-gpt-6-astra-is-generally-available-in-github-copilot/
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.