AA Index v4.2: Fable 5.1 leder etter Astra – 40 prosent privat
Artificial Analysis publiserte 4. september Intelligence Index v4.2. Det er en interimsoppdatering mot v5, ikke en ny modell. Tre dager etter GPT-6 Astra leder Anthropics Claude Fable 5.1 fortsatt. Astra er nummer to, med fire poeng over GPT-5.6 Sol.
For CIO og CISO er tre endringer mer verdifulle enn labbenes egne tabeller. 40 prosent av indeksen er nå private, holdt-ute tester, dobbelt av v4.1. GPQA Diamond er fjernet fordi fronten har mettet den. Ny AA-Briefcase veier 15 prosent og kjører kunnskapsarbeid uten internett.
Hva som faktisk er endret
Indeksen v4 ble lansert i januar. Artificial Analysis holdt den bevisst stabil gjennom de siste store modellslippene. Etter uker med rask frontflytting slipper de v4.2 som bro mot v5, med flere inkrementelle oppdateringer varslet.
v4.2 består av ti evalueringer, vektet i fire kategorier: agenter 30 prosent, koding 20, vitenskapelig resonnering 20 og generelt 30. Sammensetningen er AA-Briefcase, GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, AA-LCR v1.1, AA-Omniscience, Humanity's Last Exam, GDP.pdf og CritPt.
AA-Briefcase er ny, intern og med privat testdata. 91 oppgaver i fire scenarier, bygd som flerukers kunnskapsprosjekter med koblede deloppgaver og tusenvis av kildefiler. Agenten får Slack-eksporter, regneark, PDF-er, intervjuer og styredokumenter, og skal levere filer. Opptil 500 steg per oppgave. Ingen nett. Sandkasse via Stirrup og E2B. Scoring er rubrikk pluss parvis vurdering av oppgavesuksess, analytisk kvalitet og presentasjon.
GDP.pdf kommer fra Surge AI. 100 PDF-er i ti domener, 4 592 sider med tekst, tabeller, diagrammer, fotnoter og unntak. 1 275 ekspertkriterier. Overskriften All-pass Rate gir poeng bare når alle kriteriene er innfridd.
Holdt-ute andelen er 40 prosent: AA-Briefcase, AA-Omniscience og løsninger for CritPt. Andelen skal øke videre i v5. AA-LCR er oppdatert til v1.1 med systemprompt og rettede fasitsvar. SciCode-sandkasser straffer ikke lenger treg, men korrekt kode. Elo for GDPval-AA v2 og AA-Briefcase er re-ankret.
Tallene Artificial Analysis oppgir
Lab-rekkefølge på indeksen: Anthropic, OpenAI, Meta, SpaceXAI, Moonshot/Kimi, Z.AI, Google. Claude Fable 5.1 leder. GPT-6 Astra følger, fire poeng over GPT-5.6 Sol.
Kostnad per oppgave: Pareto-fronten deles av Anthropic, OpenAI, Meta og Z.AI. Astra dominerer ut-token-fronten nær intelligensfronten. Claude Fable 5.1, Grok 4.5 og Gemini 3.5 Flash-Lite ligger i hver sin ende av kurven. Modeller under 25 på indeksen er holdt utenfor den sammenligningen.
AA-Briefcase: Fable 5.1 og Opus 5 leder, deretter Astra og Muse Spark 1.3. Astra tar om lag 85 Elo over GPT-5.6 Sol.
GDP.pdf All-pass: Astra 33,2 prosent, GPT-5.6 Sol 28,2, Fable 5.1 26,2. Selv lederen treffer altså bare én av tre oppgaver når hvert atomkriterium må innfris.
Artificial Analysis anslår 95 prosent konfidensintervall på under ±1 prosent for selve indeksen, basert på gjentatte kjøringer. Enkelt-eval kan ha bredere intervall. Indeksen er primært engelsk tekst. Bilde, tale og flerspråk måles separat.
Hva dette betyr for innkjøp
Ikke les Astra-lanseringen som automatisk nummer én. Uavhengig sammensatt indeks, med mer privat vekt, gir Fable 5.1 forrang. Astra vinner dokumentresonnering med hard All-pass, og er mer token-effektiv nær fronten. Det er ikke det samme som billigere: Artificial Analysis skrev 3. september, i egen Astra-analyse, at høyere priser veier opp token-gevinsten i Intelligence Index.
Kostnad per oppgave er mer relevant enn tokenpris alene. At Z.AI står på Pareto-fronten sammen med de tre amerikanske labene, er et innkjøpsfaktum, ikke en fotnote.
AA-Briefcase er nærmere låst kunnskapsarbeid enn åpne quizzer: ingen nett, egne kildefiler, leveranser i filer, inntil 500 steg. Samtidig kjører hver deloppgave isolert. Modellen arver ikke sitt eget arbeid fra uken før. Det er mer rettferdig på tvers av modeller enn det er likt et ekte flerukers program.
40 prosent holdt-ute reduserer trening mot kjente sett. Det fjerner ikke insentivet til å optimalisere mot AA. Det er fortsatt én leverandørs syntese, med egne vekter. Bruk den som kontroll mot labbenes systemkort, ikke som eneste SLA.
v5 kommer. v4.2 er en bro, ikke en fasit dere kan fryse i arkitekturdokumentet.
Kilder og medier
Primærkilde: Artificial Analysis, «Announcing Artificial Analysis Intelligence Index v4.2», 4. september 2026: https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-2
Metodikk for v4.2, inkludert vekter, oppgaveantall og testramme: https://artificialanalysis.ai/methodology/intelligence-benchmarking
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.