AA: Gemini 4 Argon på 53 – 1,99 dollar, likt Astra
Artificial Analysis setter Gemini 4 Argon på 53 i Intelligence Index ved high reasoning, den høyeste settingen Google har sluppet til testerne. Likt GPT-6 Astra ved max. Ett poeng over GPT-6.1 Sol. 23 over Gemini 3.1 Pro Preview. 12 over Gemini 3.8 Flash. Listen er 4 dollar per million inn-tokens og 20 dollar per million ut. Lanseringsrabatt 50 prosent gir 2/10 i minst én måned. Cache-les 95 prosent, 0,10 dollar per million ved rabattpris. Regningen er 1,99 dollar per Intelligence Index-oppgave. Astra koster 3,26. Sol 6.1, dekket her 29. september, 0,72. Når rabatten faller, stiger Argon til 3,98, om lag 1,2 ganger Astra.
Google solgte lanseringen 30. september som frontier for koding, juss/finans og cyberforsvar. AA bekrefter at Google er tilbake i det øvre sjiktet, med egne tall. For CIO er poenget at 53 er likt Astra, ikke foran Anthropic. For FinOps er det at hele kostnadsfordelen sitter i tidsbegrenset liste, ikke i tokenbruk.
53, og hva det koster
AA målte high. Indeksen er den samme v4.3-familien som Sol- og Sonnet-målingene: ti evalueringer, blant dem AA-Briefcase, GDPval-AA, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity’s Last Exam, GDP.pdf, CritPt, AA-Omniscience og AA-LCR.
Kostnaden 1,99 dollar er 60 prosent av Astra. 2,7 ganger Sol 6.1. Effektiviteten er liste, ikke volum. Argon spytter ut 62 000 output-tokens per oppgave. Astra 27 000. Over dobbelt så mange tokens for samme 53. Når 50 prosent-rabatten er borte, blir Argon dyrere enn Astra i denne harnessen.
Modellen er ikke allment tilgjengelig. AA testet med utvalgte brukere. Google har ikke bekreftet når rabatten slutter, bare at den varer minst én måned. Cache-kuttet fra 90 til 95 prosent mot Gemini 3.8 Flash er den varige spaken for agenter som gjenbruker kontekst.
Agentikk opp, fakta mer forsiktig
Historisk svakt for Gemini. Nå leder Argon AutomationBench-AA med 78 prosent, sju poeng foran Claude Sonnet 5.5 ved max (71). Det er AAs harness, ikke Zapiers AutomationBench som Google siterte i produktnotatet. Ikke bland tallene.
Terminal-Bench 4.0: 57 prosent. Pluss 53 poeng mot Gemini 3.1 Pro Preview. Bak Sonnet 5.5 (64), Opus 5.5 (60) og Astra (59). AA-Briefcase 1494 Elo. Rubrikkpass 65 prosent, høyest AA har målt. Analytisk kvalitet 1576 Elo. Presentasjon 1308. Den leverer sjekklisten, ikke den beste analysen.
Hallusinasjon er den skarpe linjen. AA-Omniscience: 15 prosent hallusinasjonsrate. Lavest blant modeller over 45 på indeksen. Astra 51. Sol 6.1 54. Argon sier oftere nei i stedet for å gjette feil. Accuracy 50 prosent, fem under 3.1 Pro Preview og 13 under Astra (63). Samlet Omniscience 42, på linje med Astra 43 og Sol 42. Lavere løgn, ikke mer kunnskap.
Kontekstvindu 1 million tokens. Inn: tekst, bilde, video og tale. Ut: tekst. AA testet Long Decode Continuation, et Gemini-API-grep som pauser lange svar og fortsetter i neste kall, slik at resonnering kan gå mot 1 million ut-tokens uten timeout.
Googles egne DeepSWE 77,9 og Vals Index 68,9 hører hjemme i labens produktnotat, allerede dekket. Ikke bland dem med AA.
Hva styret bør gjøre
Ikke les «tilbake blant topp tre» som forbi Anthropic. Sonnet 5.5 lå på 56 og Opus 5.5 to over, i AAs måling 28. september. Argon er likt Astra på 53. Det er comeback, ikke ledelse.
Ikke budsjetter 1,99 dollar som varig pris. Uten lanseringsrabatt er oppgaven 3,98. Da taper Argon mot Astra på kostnad for samme intelligence, fordi den bruker mer enn dobbelt så mange ut-tokens.
Sett Argon på listen for agentisk automatisering og lav hallusinasjon, ikke som default-erstatning for Astra eller Opus. AutomationBench-ledelsen er relevant for flyt. Terminal-Bench er det ikke. Accuracy-hullet mot Astra er relevant for juss og finans, der Google selv selger Argon.
CISO: dette er ikke Cyber Index. Fairwind-utrullingen og cyberforsvar først er labens produktgrep, dekket i Googles eget notat 30. september. AA-indeksen her er intelligence, agentikk og fakta. Lav hallusinasjon hjelper kunnskapsarbeid. Den sier ingenting om sårbarhetsfunn.
Ikke kjøp allment. Modellen er hos utvalgte testers. API- og Ultra-tidslinje er Googles, ikke AAs. Mål kostnad per ferdig oppgave i egen harness før dere låser leverandør.
Kilder og medier
Primærkilde: Artificial Analysis, «Gemini 4 Argon: Google is back as one of the top three labs in intelligence achieved», 30. september 2026. https://artificialanalysis.ai/articles/gemini-4-argon-google-top-three-labs Artificial Analysis modellside for Gemini 4 Argon, 30. september 2026. Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.