Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

KI-briller: midlertidig forbud – skoler, sykehus, kjøpesenter • OpenAI dots: Astra 24/7 – Pro stengt i EØS, 4000 apper • AISI: Astra 29 prosent – falsk identitet, payload utenfor scope • OpenAI-agenter: 16 500 UNCTAD-skann – XSS-spill, 82 rate-limits • OpenAI: DNS-hull – pause i trening av de mest kapable

AA Cyber Index: Grok og MiMo 56 – refusals nuller Opus og Astra
CISOCIOCyberEvalueringArtificial AnalysisGrok 4.7MiMoAgenterEnterpriseSikkerhet

AA Cyber Index: Grok og MiMo 56 – refusals nuller Opus og Astra

JH
Joachim Høgby
28. september 202628. september 20265 min lesingKilde: Artificial Analysis

Artificial Analysis slipper 28. september Cyber Index, en frittstående måling av agentisk cyberforsvar. Den inngår ikke i Intelligence Index. Indeksen veier tre tester likt: CWE-Bench-AA, DeepsecBench-AA og CyberGym-E2E-AA. Alle kjører i den åpne agent-harnessen Stirrup. Lanseringspartnere er Collinear AI, IBM, NVIDIA og Vercel.

Poenget for CISO er ikke hvem som scorer høyest på generell IQ. Det er hvem som fullfører en intern sikkerhetsrevisjon i kildekode, hva det koster per oppgave, og hvor ofte modellen eller leverandøren sier nei. Refusals teller som null.

Toppen, og hvem som sier nei

Ved lansering deler Grok 4.7 (xhigh) og Xiaomis MiMo-V2.6-Pro førsteplassen med 56. GPT-6 Luna (max) ligger på 53, GLM-5.3-Flash på 50, Muse Spark 1.3 (xhigh) på 44. Deretter følger Kimi K3 (max), DeepSeek V4.1 Flash (max), GPT-6 Sol (max), GLM-5.3 (max) og GPT-6 Astra (max). Claude Opus 5.5 og Claude Fable 5.1 ligger lenger ned, merket «max with fallback».

Kostnad per oppgave skiller lederne. Ifølge Artificial Analysis’ lanseringsplot leverer GPT-6 Luna 53 for om lag 0,12 dollar per oppgave, MiMo-V2.6-Pro 56 for 0,18 dollar og GLM-5.3-Flash 50 for 0,32 dollar. Grok 4.7 matcher 56, men til 11,67 dollar. Samme forsvarsscore, to størrelsesordener i pris.

På CyberGym-E2E-AA nekter GPT-6 Astra, GPT-6 Sol, Claude Fable 5.1, Claude Opus 5.5 og begge Qwen3.8-variantene minst 98 prosent av oppgavene. Artificial Analysis skriver at det gjør frontier-modellene vanskelige å vurdere der. Indeksen er bevisst forsvar: modellene får kildekoden, som en intern revisor. Ingen oppgave ber om et ferdig angrep.

Hva som faktisk måles

CWE-Bench-AA er 120 held-out oppgaver over alle ti OWASP Top 10 (2025), i C/C++, Go, Java, JavaScript/TypeScript, Python og Rust. Agenten får et repo og et område å revidere, ikke nøyaktig linje. To timer i isolert sandbox uten nett. Poeng bare hvis sårbarheten er stengt og legitim atferd fortsatt virker. Scoren er pass@1.

Feilene er mer nyttige enn pallen. 55 prosent av mislykkede forsøk, uten refusals og timeout, fikset hovedfeilen men lot en relatert inngang stå. Overkorrigering sto for om lag 24 prosent av feilene, og om lag 40 prosent hos de fire beste. Modellene brukte i snitt 38 prosent av turene på å lete før første endring.

DeepsecBench-AA isolerer funn. Agenten går gjennom scanner-flaggede filer og rapporterer mot et gyllent sett verifisert av mennesker. Headline er F2, median av tre kjøringer, fordi en miss koster mer enn en falsk positiv. Beste modell fant bare 41 prosent av de ekspertverifiserte sakene. Feil med direkte sti fra utrygg input til konsekvens fanges oftere. Feil som krever sekvens og forretningsregler nesten aldri. Når slike likevel rapporteres, er 95 prosent riktige. GPT-6 Sol og GPT-6 Astra treffer dem i om lag 30 prosent av kjøringene, to til fire ganger typisk modell. Dommeren er GPT-5.6 Sol.

CyberGym-E2E-AA er 131 minnesikkerhetsfeil, én per C/C++-prosjekt, filtrert fra Berkeley RDIs 920. Agenten skal finne feilen, lage en input som utløser sanitizer-krasj, og patche slik at krasjet ikke lenger inntreffer mens prosjektets tester består. Tidsgrense 90 minutter. Hos modellene som ikke nekter treffer 42 prosent av forsøkene tidsgrensen uten krasj-input. 31 prosent av «pass» retter feil krasj. Out-of-bounds går gjennom i 50 prosent av forsøkene, use-after-free i 33, heltalls- og aritmetikkfeil i 20.

Hva indeksen ikke er

Cyber Index er ikke Intelligence Index. Den måler ikke offensiv evne, hendelseshåndtering, «skriv ny kode uten hull», mål uten kildekode eller live servere. Exploit-realisering er utenfor scope. Tallene er AA-implementasjoner på Stirrup, ikke direkte sammenlignbare med Collinear og Vercels egne tavler. CWE-settet er privat. DeepsecBench-settet likeså.

For ledergruppen: velg modell etter refusals og kostnad per ferdig revisjon, ikke etter generell evne. Luna og MiMo ligger på Pareto. Grok betaler 11,67 dollar for samme 56. Opus og Astra kan være husets sterkeste kodeagenter og likevel være ubrukelige på denne sløyfen hvis de sier nei. Claude-fallback er synlig i merkelappen. Test i egen sandbox før SOC-agenter får repo-tilgang. Indeksen sier hva modellene gjør med kildekode foran seg, ikke hva de gjør mot et system uten.

Kilder og medier

Primærkilde: Artificial Analysis, «Announcing the Artificial Analysis Cyber Index Alliance: toward better benchmarking of agentic cyber defense», 28. september 2026. https://artificialanalysis.ai/articles/artificial-analysis-cyber-index

Metodikk: Artificial Analysis, Cyber Index Benchmarking Methodology.

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.