AA Index v4.3: Astra og Fable 5.1 like – Astra 57 prosent billigere
Artificial Analysis publiserte 7. september Intelligence Index v4.3. Det er ikke en ny modell. Det er en ny måling av modellene dere allerede vurderer å kjøpe.
Claude Fable 5.1 (max, med fallback) og GPT-6 Astra (max) lander begge på 53. I v4.2 ledet Fable 5.1. Nå er de like. Forskjellen som teller for innkjøp ligger i oppgavetypen og i fakturaen: 3,26 dollar per indekssoppgave for Astra mot 7,63 for Fable 5.1. Astra er 57 prosent billigere for samme samlede score.
For CIO og CISO er to endringer mer verdifulle enn labbenes egne tabeller. Terminal-Bench er oppgradert til v4.0 med hardere terminalarbeid. τ³-Banking er byttet ut med AutomationBench-AA: 657 forretningsflyter mot Zapier, med privat testdata. Andelen holdt-ute tester stiger fra 40 til 45 prosent.
Hva som faktisk er endret
v4.3 er en interimsoppdatering mot v5, tre dager etter v4.2. Kategoriene er uendret: agenter 30 prosent, koding 20, generelt 30 og vitenskapelig resonnering 20.
Ti evalueringer inngår: AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench v4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience og AA-LCR v1.1.
Terminal-Bench v4.0 tester om en agent kan gjøre kompleks jobb gjennom terminalen, på tvers av programvare, maskinlæring, vitenskap, drift, sikkerhet, maskinvare og media. Artificial Analysis kjører alle 66 oppgaver tre ganger og rapporterer gjennomsnittlig pass@1.
AutomationBench-AA er deres implementasjon av Zapiers arbeidsflyt-benchmark, versjon 1.0.6. 657 oppgaver i finans, HR, markedsføring, drift, salg og support. Agenten skal finne relevante API-er i simulerte forretningsapper. Delmål gir delpoeng. Enhver brudd på guardrail setter oppgaven til null. «Score» er gjennomsnittet over alle 657 flyter. «Tasks Completed» er andelen der alle mål er innfridd uten brudd.
Tallene Artificial Analysis oppgir
Samlet indeks: Fable 5.1 og Astra 53, deretter Claude Opus 5 (max) 51, Fable 5 (med fallback) 50, Muse Spark 1.3 (max) 48 og GPT-5.6 Sol (max) 47.
Åpne vekter: GLM-5.3 og Kimi K3 leder. GLM-5.3-Flash scorer 42 og er tredje sterkeste åpne modell, foran Qwen3.8 2.4T A95B på 40 og DeepSeek V4 Pro 0813 (max) på 36.
Terminal-Bench v4.0: Astra 59,1 prosent, Fable 5.1 52,0, Opus 5 49,0. Astra er 19,2 prosentpoeng foran GPT-5.6 Sol på 39,9.
AutomationBench-AA Score: Astra 68,5 prosent, Grok 4.6 (high) 66,7, GLM-5.3 (max) 62,2. Fullføring uten guardrail-brudd: Astra 41,6 prosent av flytene, Fable 5.1 32,1, Opus 5 28,3.
Fable 5.1 scorer høyere på AA-Briefcase og SciCode. Astra scorer høyere på Terminal-Bench v4.0 og AutomationBench-AA.
Kostnad: OpenAI tar mesteparten av Pareto-fronten for intelligens mot kostnad. Alle fem resonneringsnivåene av Astra gir lavest kostnad per oppgave på sitt intelligensnivå. Resten av fronten er MiMo-V2.5-Pro (26), GLM-5.3-Flash (42) og Fable 5.1 (xhigh og max, 53).
Samme indeks, ulik pris: GLM-5.3-Flash og GPT-5.6 Terra (max) scorer begge 42, men Flash koster 0,25 dollar per oppgave mot 1,40. GPT-5.6 Luna (max) scorer 38 til 0,18 dollar.
Hva dette betyr for innkjøp
Ikke les en tied score som at modellene er like i produksjon. Astra vinner terminal og forretningsflyt. Fable 5.1 vinner kunnskapsarbeid og SciCode. Hvis dere kjøper kodeagenter og automatisering, peker v4.3 mot Astra. Hvis dere kjøper dokumenttungt kunnskapsarbeid, peker Briefcase fortsatt mot Fable.
Kostnad per oppgave slår tokenpris. Astra bruker færre ut-tokens. Fable 5.1 koster mer enn dobbelt per indekssoppgave til samme 53. Det er FinOps, ikke benchmark-støy.
Grok 4.6 ligger rett bak Astra på AutomationBench. GLM-5.3 er med i toppen på forretningsflyt og på Pareto-fronten via Flash. Det er et innkjøpsvindu, ikke en open-weights-seier.
45 prosent privat testdata reduserer trening mot kjente sett. Det fjerner ikke insentivet til å optimalisere mot AA. Bruk indeksen som kontroll mot labbenes systemkort, ikke som eneste SLA.
v5 kommer. v4.3 er en hardere agentmåling, ikke en fasit dere kan fryse i arkitekturdokumentet.
Kilder og medier
Primærkilde: Artificial Analysis, «Announcing the Artificial Analysis Intelligence Index v4.3», 7. september 2026: https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-3
Metodikk og versjonshistorikk: https://artificialanalysis.ai/methodology/intelligence-benchmarking
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.