Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face • Bloomberg: NVIDIA-kunder varsles om over 15 prosent prishopp på AI-servere • OpenAI kutter GPT-5.6 Sol mer enn 20 prosent – i tre måneder

AA Index v4.3: Astra og Fable 5.1 like – Astra 57 prosent billigere
AI-modellerArtificial AnalysisEvalueringGPT-6 AstraClaude Fable 5.1CIOCISOFinOpsKodeagenter

AA Index v4.3: Astra og Fable 5.1 like – Astra 57 prosent billigere

JH
Joachim Høgby
7. september 20267. september 20265 min lesingKilde: Artificial Analysis

Artificial Analysis publiserte 7. september Intelligence Index v4.3. Det er ikke en ny modell. Det er en ny måling av modellene dere allerede vurderer å kjøpe.

Claude Fable 5.1 (max, med fallback) og GPT-6 Astra (max) lander begge på 53. I v4.2 ledet Fable 5.1. Nå er de like. Forskjellen som teller for innkjøp ligger i oppgavetypen og i fakturaen: 3,26 dollar per indekssoppgave for Astra mot 7,63 for Fable 5.1. Astra er 57 prosent billigere for samme samlede score.

For CIO og CISO er to endringer mer verdifulle enn labbenes egne tabeller. Terminal-Bench er oppgradert til v4.0 med hardere terminalarbeid. τ³-Banking er byttet ut med AutomationBench-AA: 657 forretningsflyter mot Zapier, med privat testdata. Andelen holdt-ute tester stiger fra 40 til 45 prosent.

Hva som faktisk er endret

v4.3 er en interimsoppdatering mot v5, tre dager etter v4.2. Kategoriene er uendret: agenter 30 prosent, koding 20, generelt 30 og vitenskapelig resonnering 20.

Ti evalueringer inngår: AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench v4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience og AA-LCR v1.1.

Terminal-Bench v4.0 tester om en agent kan gjøre kompleks jobb gjennom terminalen, på tvers av programvare, maskinlæring, vitenskap, drift, sikkerhet, maskinvare og media. Artificial Analysis kjører alle 66 oppgaver tre ganger og rapporterer gjennomsnittlig pass@1.

AutomationBench-AA er deres implementasjon av Zapiers arbeidsflyt-benchmark, versjon 1.0.6. 657 oppgaver i finans, HR, markedsføring, drift, salg og support. Agenten skal finne relevante API-er i simulerte forretningsapper. Delmål gir delpoeng. Enhver brudd på guardrail setter oppgaven til null. «Score» er gjennomsnittet over alle 657 flyter. «Tasks Completed» er andelen der alle mål er innfridd uten brudd.

Tallene Artificial Analysis oppgir

Samlet indeks: Fable 5.1 og Astra 53, deretter Claude Opus 5 (max) 51, Fable 5 (med fallback) 50, Muse Spark 1.3 (max) 48 og GPT-5.6 Sol (max) 47.

Åpne vekter: GLM-5.3 og Kimi K3 leder. GLM-5.3-Flash scorer 42 og er tredje sterkeste åpne modell, foran Qwen3.8 2.4T A95B på 40 og DeepSeek V4 Pro 0813 (max) på 36.

Terminal-Bench v4.0: Astra 59,1 prosent, Fable 5.1 52,0, Opus 5 49,0. Astra er 19,2 prosentpoeng foran GPT-5.6 Sol på 39,9.

AutomationBench-AA Score: Astra 68,5 prosent, Grok 4.6 (high) 66,7, GLM-5.3 (max) 62,2. Fullføring uten guardrail-brudd: Astra 41,6 prosent av flytene, Fable 5.1 32,1, Opus 5 28,3.

Fable 5.1 scorer høyere på AA-Briefcase og SciCode. Astra scorer høyere på Terminal-Bench v4.0 og AutomationBench-AA.

Kostnad: OpenAI tar mesteparten av Pareto-fronten for intelligens mot kostnad. Alle fem resonneringsnivåene av Astra gir lavest kostnad per oppgave på sitt intelligensnivå. Resten av fronten er MiMo-V2.5-Pro (26), GLM-5.3-Flash (42) og Fable 5.1 (xhigh og max, 53).

Samme indeks, ulik pris: GLM-5.3-Flash og GPT-5.6 Terra (max) scorer begge 42, men Flash koster 0,25 dollar per oppgave mot 1,40. GPT-5.6 Luna (max) scorer 38 til 0,18 dollar.

Hva dette betyr for innkjøp

Ikke les en tied score som at modellene er like i produksjon. Astra vinner terminal og forretningsflyt. Fable 5.1 vinner kunnskapsarbeid og SciCode. Hvis dere kjøper kodeagenter og automatisering, peker v4.3 mot Astra. Hvis dere kjøper dokumenttungt kunnskapsarbeid, peker Briefcase fortsatt mot Fable.

Kostnad per oppgave slår tokenpris. Astra bruker færre ut-tokens. Fable 5.1 koster mer enn dobbelt per indekssoppgave til samme 53. Det er FinOps, ikke benchmark-støy.

Grok 4.6 ligger rett bak Astra på AutomationBench. GLM-5.3 er med i toppen på forretningsflyt og på Pareto-fronten via Flash. Det er et innkjøpsvindu, ikke en open-weights-seier.

45 prosent privat testdata reduserer trening mot kjente sett. Det fjerner ikke insentivet til å optimalisere mot AA. Bruk indeksen som kontroll mot labbenes systemkort, ikke som eneste SLA.

v5 kommer. v4.3 er en hardere agentmåling, ikke en fasit dere kan fryse i arkitekturdokumentet.

Kilder og medier

Primærkilde: Artificial Analysis, «Announcing the Artificial Analysis Intelligence Index v4.3», 7. september 2026: https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-3

Metodikk og versjonshistorikk: https://artificialanalysis.ai/methodology/intelligence-benchmarking

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.