Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

OpenAI dots: Astra 24/7 – Pro stengt i EØS, 4000 apper • AISI: Astra 29 prosent – falsk identitet, payload utenfor scope • OpenAI-agenter: 16 500 UNCTAD-skann – XSS-spill, 82 rate-limits • OpenAI: DNS-hull – pause i trening av de mest kapable • OpenAI-agenter la ut 53 brukerbilder – kan ikke varsle ofrene

Terminal-Bench-Science: Astra 63,3 – Opus 61,9, åpne vekter under 12
Artificial AnalysisEvalueringOpenAIAnthropicCIOCISOAI-modellerFoU

Terminal-Bench-Science: Astra 63,3 – Opus 61,9, åpne vekter under 12

JH
Joachim Høgby
25. september 202625. september 20265 min lesingKilde: Artificial Analysis

Artificial Analysis la 24. september ut en uavhengig lederboard for Terminal-Bench-Science 0.1. GPT-6 Astra (max) tar 63,3 prosent. Claude Opus 5.5 med xhigh effort tar 61,9. Bare de to modellfamiliene kommer over 50 prosent. Beste åpne vekter ligger på 9–10 prosent. For CIO i FoU er dette et kjøpsfilter, ikke en quiz. For CISO er det en påminnelse om at vitenskapsagenten får sandbox, data, verktøy og timer.

Hva som faktisk ble sluppet

Terminal-Bench-Science er et åpent akademisk samarbeid fra Stanford-forskere med Terminal-Bench- og Harbor-teamet. Utgaven 0.1.0 har 70 ekspertkuraterte forskningsflyter: 19 i livsvitenskap, 17 i fysikk, 17 i matematikk, 9 i ingeniørfag og 8 i geovitenskap. Agenten får data, verktøy og instruks i et terminalmiljø. Oppgaven er bestått bare hvis alle forfatterens tester passerer.

Artificial Analysis kjører alle modeller i samme mini-swe-agent-harness og rapporterer pass@1, gjennomsnitt over tre forsøk. Det er poenget. Tallene er ikke labenes egne Codex- eller Claude Code-kjøringer. Lederboarden er primærkilden, kunngjort av @ArtificialAnlys 24. september.

Eksemplene er ikke multiple choice. Én geovitenskapsoppgave ber agenten rekonstruere islegging og isløsning for ti vintre fra Landsat- og MODIS-bilder, med faste regler for dekning, sky, reflektans og en tidsfrist på 28 800 sekunder. En livsvitenskapsoppgave ber om full slektslinje fra 800 bilder av muse-myoblaster. Dette er forskningsarbeid, ikke MMLU.

Tallene som tåler sjekk

AA-siden, avlest 26. september, gir disse pass@1-tallene:

GPT-6 Astra (max) 63,3 prosent. Claude Opus 5.5 (xhigh, default fallback) 61,9. Samme modell på max 59,0, på high 49,0, på medium 43,3 og på low 24,3. Claude Fable 5.1 (max) 43,3. GPT-6 Sol (max) 30,0. Claude Opus 5 (max) 28,6. GPT-5.6 Sol (max) 22,4.

Utenfor OpenAI og Anthropic faller feltet. Qwen3.8 Max (0902) 11,9 prosent. Meta Muse Spark 1.3 (max) 11,0. Gemini 3.8 Flash (high) 10,0. GLM-5.3 (max, åpne vekter) 9,5. DeepSeek V4.1 Flash (max, åpne vekter) 9,0. Grok 4.6 (high) 6,2. GPT-6 Luna (max) 8,6. To modeller i utvalget scorer null.

Domener, tre forsøk, støy fordi noen felt har 8–19 oppgaver: Astra (max) tar 78,4 prosent i matematikk og 57,9 i livsvitenskap. Opus 5.5 (xhigh) tar 70,6 i matematikk og 45,6 i livsvitenskap, med 66,7 i fysikk, ingeniørfag og geovitenskap. Livsvitenskap er bunnen for de fleste i toppen.

Effort er en spak, ikke pynt. Opus 5.5 går omtrent 38 poeng fra low til xhigh. AA skriver i kunngjøringen at kostnaden per oppgave øker omtrent fem ganger over det spennet, og at max scorer litt under xhigh. Mer tenking er ikke automatisk mer treff.

Hva dette betyr for lederbordet

To lukkede laber er i en annen liga på ekte forskningsflyter i terminal. Åpne vekter ligger mer enn 50 poeng bak Astra. «Vi kjører lokal modell på labdata» er et styringsvalg, ikke et ytelsesvalg, på denne basen.

Harnessen er en del av produktet. AA tvinger mini-swe-agent på alle. Native Claude Code eller Codex kan gi andre tall. Ikke lim inn leverandørens systemkort og kall det innkjøpsgrunnlag. Krev samme harness, samme forsøk og kostnad per bestått oppgave.

Effort-innstilling er budsjett. xhigh slår max her. En FoU-pilot som låser «max» uten å måle, betaler for tokens uten å kjøpe treff. Mål passrate per domene, ikke ett totaltall. Livsvitenskap er den harde kanten.

For CISO: oppgavene gir agenten lokale data og lang kjøretid. Det er samme klasse risiko som andre lange agenter: verktøybruk, data ut, og et artefakt som ser vitenskapelig ut før et menneske har sjekket det. Sandbox er ikke det samme som godkjent metode.

Det som fortsatt er åpent

70 oppgaver er lite. Domeneandeler med åtte oppgaver tåler ikke fine rangeringskrav. AA tar imot bidrag til versjon 0.2. Lederboarden vil flytte seg. Offisielle labtall med andre agenter vil fortsette å avvike. Dette er ett uavhengig kutt, 24. september, ikke en evig rangering.

Kilder og medier

Primærkilde: Artificial Analysis, Terminal-Bench-Science 0.1 Benchmark Leaderboard, https://artificialanalysis.ai/evaluations/terminal-bench-science Kunngjøring: Artificial Analysis på X, 24. september 2026, https://x.com/ArtificialAnlys/status/2103265956479070260 Benchmark: Terminal-Bench-Science / Stanford, Harbor og Terminal-Bench-teamet, https://terminal-bench-science.ai/ Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.