Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

OpenAI dots: Astra 24/7 – Pro stengt i EØS, 4000 apper • AISI: Astra 29 prosent – falsk identitet, payload utenfor scope • OpenAI-agenter: 16 500 UNCTAD-skann – XSS-spill, 82 rate-limits • OpenAI: DNS-hull – pause i trening av de mest kapable • OpenAI-agenter la ut 53 brukerbilder – kan ikke varsle ofrene

ThinkingBox: 67 % rene feil – ticket solved, hold krevd
CIOCISOStyreMicrosoftAgenterEvalueringCopilotHugging FaceFinOpsLeverandørstyring

ThinkingBox: 67 % rene feil – ticket solved, hold krevd

JH
Joachim Høgby
4. oktober 20264. oktober 20266 min lesingKilde: Microsoft

Microsoft og Hugging Face publiserer ThinkingBox 3. oktober. Sandkassen graderer AI-agenter på postene de etterlater i databasen, ikke på setningene de skriver. 507 tilstandsendrende arbeidsflyter. Hver kjøres 20 ganger. Det er Copilot Studio-teamet, Toloka og internforskere bak.

Eksempelet er konkret. En kunde har et kjøkkenapparat til 745 dollar, 15 dager forsinket hos en kurer i Nashville. Agenten gjør ni verktøykall: ordre, sporing, kundekort, refusjonspolicy to ganger, sjekker at det ikke finnes sak, åpner én, dokumenterer tidslinjen og leser policyen riktig. Segmentet hennes gir ikke kompensasjon. Så lukker den saken som solved og spør om det er mer den kan hjelpe med.

To feil. Kurereksepsjonen er åpen, så påkrevd sluttstatus var hold. Kunden fikk ikke svar på det hun faktisk spurte om. En grader som ser på verktøykall ser ni velformede kall. Databasen er uenig. Feltet som feller oppgaven er ett: ticket-status solved der hold var krevd. Oppgaven heter sandbox_external_retail_group1.py:test_case_ST003_006.

Hva som måles

ThinkingBox er sandkassen. ThinkingBox-Bench er datasettet. Hver oppgave har starttilstand, brukermål, MCP-verktøy, domenepolicy og kjørbare sjekker mot slutt-tilstand. En simulert bruker sitter på privat kontekst og slipper den bare når den blir spurt. Hvert forsøk får isolert MCP-sesjon med fersk database. To forsøk av samme oppgave deler aldri rad eller cache.

På slutten trekkes sideeffekter ut. Deterministiske dommere godtar enhver bane som gir riktig slutt-tilstand, og avviser feil, manglende eller ekstra effekter. 477 av 507 oppgaver grades kun på tilstand. 30 har også svar-rubrikker. Modellen ser oppgaver, dialog og verktøyskjema. Gull-tilstand, assertions og credentials blir på evaluatorsiden.

Domenene: retail 98, bilforsikring 100, reise 104, neobank 104, konsulent IT/HR 101. Alle oppgavene er syntetiske rekonstruksjoner av virksomhetsmønstre. Kundene er ikke ekte.

Ett treff er ikke pålitelighet

I en felles ablasjon, 121 680 gyldige forsøk på 12 modeller, falt 79 853 på de kjørbare sjekkene. Av feilene avsluttet 67,24 prosent rent, kalte et tilstandsendrende verktøy og rapporterte ingen sluttfeil. Likevel: feil feltverdi i 77,61 prosent, utilsiktede ekstra effekter i 43,30 prosent, manglende påkrevde effekter i 25,36 prosent. Overlapp finnes. En bane er et krav. Databasetilstand er evidensen.

Tre tall rapporteres. pass@1: andel treff på ett forsøk. pass@20: andel oppgaver løst minst én gang på 20. Observert 20/20: oppgaver som traff alle 20, uten estimator.

pass@1, oppgavevektet over 507, labens tabell: Claude Opus 5.5 67,16. Claude Opus 5 66,50. GPT-5.4 65,36. GPT-5.6 Sol 61,91. Claude Sonnet 4.6 59,19. GPT-6 Astra 58,31. Åpne vekter: Kimi-K3 57,37, innenfor ett poeng av Astra. Qwen3.8-27B 51,70. DeepSeek-V4-Pro 43,26. Mistral-Large-3 4,66. Standardfeil står i papirets tabell 4.

Domene slår modellnavn. Claude Opus 4.6 tar 68,62 på retail og 8,30 på bilforsikring. Snitt over modellene i tabellen: retail 59,52 pass@1, bilforsikring 33,83.

20/20 er kolonnen som teller

Kimi-K3 løser 476 av 507 minst én gang, 93,89 prosent. Bare 31 oppgaver slår den helt. På retail leder den med 82,24 pass@1, foran alle proprietære. Den er også blant de minst konsistente: 68 av 507, 13,41 prosent, treffer alle 20.

Claude Opus 5 inverterer det. Færre oppgaver minst én gang, 79,09 prosent, 106 tap. Men 47,53 prosent av benken treffer hver eneste gang, 241 oppgaver. Opus 5.5 er høyere på pass@1, 67,16 mot 66,50, og løser flere minst én gang. Antall 20/20-oppgaver er identisk: 241. En halv poeng i overskrift kjøpte null mer pålitelighet.

Hvor mye av pass@1 overlever 20 repetisjoner: GPT-6 Astra beholder 78 prosent. Opus 5.5 og Opus 5 beholder 71. GLM-5.1, Kimi-K2.6 og DeepSeek-V4-Pro beholder rundt 8 prosent.

Hva konsistens koster

Kostnad per vellykket oppgaveforsøk er estimert listpris på OpenRouter 20. september 2026, uten rabatt og uten kvantiserte endepunkt, delt på treff. Det er en sammenligningsindeks, ikke en faktura.

Pareto-fronten har tre trinn. GPT-5.6 Sol er billigst per treff, 0,127 dollar. GPT-5.4 løfter pass@1 3,45 poeng for 0,004 dollar mer. Opus 5.5 legger på 1,80 poeng til 0,276 dollar per treff. Opus 5 er både dyrere og dårligere enn 5.5: 0,475 dollar og 66,50.

Så prises konsistens: kostnad for hele 20-kjøringen delt på oppgaver med 20/20. GPT-5.4: 128 oppgaver, 6,80 dollar per avhengig oppgave. GPT-6 Astra: 231 oppgaver, 7,45. Opus 5.5: 241 oppgaver, 7,80. Opus 5 også 241, men 13,30. Sol er billigst per enkelt treff og dyrere per avhengig oppgave, 9,76. Billigste vei til ett riktig svar er ikke billigste vei til et pålitelig.

Feilmønsteret

Hver feilet spor får én deterministisk signatur. Uvektet snitt av per-modell-andeler, papirets tabell 5: verktøyhåndtering 79,9 prosent. Feil tilstandsoppdatering 10,3. Ufullstendig brukeravklaring 7,0. Ingen tilstandsendrende handling 2,9. Agentene kommer vanligvis langt nok til å forsøke flyten, og feiler så på verktøyfeil, brutte prebetingelser eller tomme oppslag. Det er retry og feilgjenoppretting før det er «større modell».

Microsoft har ikke målt løftet av tiltakene under på denne benken. Signalet de graderer på, finnes i produksjon: sjekk slutt-tilstand før du committer, ikke modellens sammendrag. Klassifiser verktøy- og systemfeil så retry treffer de som kan reddes. Kutt verktøyflaten til det flyten trenger. Krev menneskelig godkjenning på endringer som ikke er billige å reversere.

Hva det betyr for CIO og CISO

Agenter som skriver i sak, ERP, kjernebank, forsikring eller HR kan ikke grades på chat. «Saken er løst» i svaret er ikke evidens. Evidensen er raden.

Velg modell på 20/20, eller det k som deres endringsvindu tåler, ikke på pass@1. En modell som treffer én av fem refunderinger er ikke en refund-agent. Kimi-K3 viser at bredde og konsistens kan peke hver sin vei. Opus 5.5 viser at en nyere versjon kan løfte snittet uten å løfte det dere kan stole på hver gang.

Kostnadsbildet snur når dere krever gjentak. Sol vinner enkelt-treff. Astra og Opus 5.5 er nærmere når oppgaven må treffe 20 av 20. Prisene er labens indeks mot OpenRouter-lister, ikke deres avtale.

Styring: isolert verktøysesjon, logging av slutt-tilstand, ingen deling av gull-sjekker med modellen. Human-in-the-loop på irreversible writes. Leverandørkrav: vis repeat-metrikk, si om det er best-of-k eller every-of-k, og hvordan det er regnet. OpenEnv-adapteren returnerer binær pass/fail per episode. Koden er MIT, benkedata CDLA-Permissive-2.0.

For norske virksomheter: dette treffer saksflyt i offentlig sektor, bank, forsikring og industri like mye som amerikansk retail. Hvis agenten får lov til å lukke ticket, bokføre eller endre avtale, er databasen kontrollplanet.

Begrensninger

Papiret på arXiv er datert 20. august 2026. Nyheten 3. oktober er at harness, datasett og OpenEnv-adapter er sluppet til kjøring. Modellsettet blander GPT-5.x og GPT-6; det er ikke en live-leaderboard mot dagens produksjonsendepunkt. Kostnad er estimat, ikke skyregning. Signaturene er observerbare etiketter, ikke unike årsaker. Syntetiske oppgaver. Microsoft eier benken og selger Copilot Studio. Kjør egne modeller mot OpenEnv før innkjøp.

Kilder og medier

Primærkilde: Microsoft, «The Agent Said It Was Done. The Database Disagreed.», Hugging Face, 3. oktober 2026. https://huggingface.co/blog/microsoft/thinkingbox

Paper: Li mfl., «One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows», arXiv:2608.19741. https://arxiv.org/abs/2608.19741

Kode: microsoft/thinkingbox (MIT). Datasett: microsoft/thinkingbox-data, v1.0 (CDLA-Permissive-2.0). https://github.com/microsoft/thinkingbox

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.