Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face • Bloomberg: NVIDIA-kunder varsles om over 15 prosent prishopp på AI-servere • OpenAI kutter GPT-5.6 Sol mer enn 20 prosent – i tre måneder

Ny CRI-benchmark tester AI der fasit ikke finnes
AI-modellerBenchmarkAI-sikkerhetLedelseAnthropic

Ny CRI-benchmark tester AI der fasit ikke finnes

JH
Joachim Høgby
13. august 202613. august 20264 min lesingKilde: Anthropic Alignment Science Blog

Anthropic og Redwood Research har publisert Conceptual Reasoning Index, CRI, en ny benchmark for en av de mer ubehagelige sidene ved AI-ledelse: beslutninger der det ikke finnes en enkel fasit.

Dette er ikke en ny modell. Det er en ny målemetode for hvor godt de beste modellene faktisk kan resonnere om vanskelige, åpne spørsmål. Ikke kode som kan kjøres. Ikke matte som kan verifiseres. Ikke en standard flervalgstest der riktig svar ligger klart i datasettet. CRI retter seg mot domener der ledere, sikkerhetsmiljøer og AI-labene selv må ta valg med ufullstendig informasjon, lange tidshorisonter og svak feedback.

Det gjør lanseringen viktigere enn den ser ut. De fleste virksomheter evaluerer i dag AI på oppgaver med raske signaler: skriver modellen riktig kode, finner den svaret i dokumentene, klarer den supportflyten, treffer den på testsettet. Det er nyttig, men det måler bare den delen av arbeidet som er lett å kontrollere. Etter hvert som modeller flyttes inn i strategi, risikostyring, produktvalg, sikkerhetsarbeid og agentstyrte prosesser, blir det kritiske spørsmålet et annet: kan modellen argumentere godt når ingen billig test forteller om den har rett?

CRI prøver å sette tall på nettopp det. Indeksen samler tre benchmarkspor: LMCA for vurdering av konseptuelle argumenter, ACCoRD for logisk konsistens i modellens egne vurderinger og preferanser, og DTBench for beslutningsteoretiske problemer. Vektingen er foreløpig 60 prosent LMCA, 20 prosent ACCoRD og 20 prosent DTBench. Ifølge publiseringen ble modellene kjørt med maksimale tokenrammer og høyeste effort-nivåer, altså ikke i billigste hverdagsmodus.

Resultatet er en leaderboard som er mer interessant enn en vanlig modellrangering. Høyeste rapporterte modell er Claude Opus 5 med CRI-score 73,6, med 95 prosent konfidensintervall på pluss/minus 2,1. Forfatterne anslår et praktisk tak rundt 91, fordi menneskelige ekspertvurderinger på argumentkvalitet også er støyete. Det betyr at selv de beste modellene fortsatt har tydelig avstand til nivået man ideelt ønsker for arbeid som krever trygg, konsistent og nyansert vurdering uten fasit.

For CIOer og CISOer er den operative lærdommen ganske enkel: ikke bland sammen høy score på kode, matte eller agentsimuleringer med modenhet for styringsbeslutninger. En modell kan være brutal på pull requests og fortsatt svak på å vurdere om en risikoreduserende plan faktisk holder vann. Den kan være rask i en agentharness og samtidig inkonsistent når den må prioritere mellom uklare sikkerhetshensyn.

Dette treffer særlig selskaper som bygger interne agentplattformer. Når AI-agenter får ansvar for research, policyforslag, leverandørvurderinger, hendelsesanalyse eller beslutningsstøtte, er kvaliteten på argumentasjonen en kontrollflate. Da holder det ikke å logge at agenten kom fram til et svar. Man må kunne se om svaret bygger på konsistent premissbruk, om motargumentene faktisk er vurdert, og om modellen skiller mellom empiriske funn, antakelser og rene vurderinger.

CRI er også et lite spark til benchmark-industrien. Mye av markedet elsker tester som er billige å kjøre og enkle å rangere. Problemet er at slike tester skaper en skjev trygghet. De belønner det som kan verifiseres raskt, mens mange av de dyreste feilene i virksomheter kommer fra dårlige vurderinger som ser plausible ut lenge nok til å slippe gjennom. Her ligger også koblingen til AI-sikkerhet: hvis fremtidige modeller skal hjelpe med styring, alignment og risikoreduksjon, må de bli gode på spørsmål der vi ikke får en klar dommer gratis.

Det er likevel grunn til å være nøktern. CRI er nytt, smalt og laget for et avansert forskningsområde. Det er ikke en generell innkjøpsscore, og det bør ikke brukes alene til modellvalg. Datasettet og vurderingene kommer fra mennesker med bestemt ekspertise, og målingen av konseptuell resonnering vil alltid være mer omstridt enn en kompileringstest. Men som signal er det sterkt: feltet beveger seg fra å spørre om modeller kan løse oppgaver, til å spørre om de kan hjelpe oss å tenke bedre i situasjoner der svaret ikke er observerbart ennå.

Den praktiske konsekvensen er at virksomheter bør utvide eval-regimet sitt. Fortsett med kostnad, hastighet, kodekvalitet, retrieval-presisjon og sikkerhetsgrenser. Men legg til tester for argumentkvalitet, konsistens over tid, evne til å vurdere motargumenter og tydelig separasjon mellom fakta og skjønn. Det er der AI går fra verktøy til medrådgiver. Og det er der risikoen blir størst hvis modellen høres klok ut uten å være det.

Kilder og medier

Primærkilde: Anthropic Alignment Science Blog / Redwood Research, "Introducing the Conceptual Reasoning Index" - https://alignment.anthropic.com/2026/conceptual-reasoning-index

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.