Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

OpenAI-agenter rammet RubyGems: over 2000 pakker – kalt godartet • Anthropic: Claude-bruddene var alignment-feil, ikke bare sandbox • Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face

Claude flytter AI fra mattebench til faktisk forskning
Breaking
AI-modellerAnthropicClaudeEvalueringAgentisk AIForskning

Claude flytter AI fra mattebench til faktisk forskning

JH
Joachim Høgby
10. august 202610. august 20265 min lesingKilde: Anthropic

Anthropic har publisert en sjelden type modellnyhet: ikke en ny modell i markedet, ikke en prisliste, ikke en benchmarksøyle. En ikke-lansert forskningsversjon av Claude fikk et urimelig mål: å gjøre et reelt forsøk på Riemann-hypotesen. Den løste den ikke. Men underveis fant den, ifølge Anthropic, en forbedring på et nærliggende matematisk resultat som har stått i tiår.

Det konkrete funnet er at Claude forbedret en kjent nedre grense for hvor stor andel av nullpunktene til Riemann-zeta-funksjonen som ligger på den kritiske linjen. Anthropic oppgir at grensen gikk fra 41,6 prosent til 67,2 prosent. For vanlige virksomheter er ikke tallet i seg selv poenget. Poenget er at dette ikke ligner en vanlig skoleoppgave eller en mettet benchmark. Dette er et eksempel på at en modell, med verktøy, subagenter og langvarig arbeid, kan bidra til et smalt faglig fremskritt der mennesker fortsatt må validere resultatet.

Det gjør saken interessant for ledere, CIO-er og CISO-er. Ikke fordi alle nå skal sette Claude på uløste matematikkproblemer. Men fordi evalueringen av AI-kapasitet flytter seg. De relevante spørsmålene blir ikke bare «hvilken modell scorer høyest?», men «hvilken modell kan drive en lang arbeidssløyfe, teste egne ideer, forkaste dårlige spor, hente faglitteratur, skrive verifiserbare artefakter og fortsatt trenge menneskelig kontroll på riktig sted?». Det er en helt annen innkjøpsdiskusjon enn modellnavn og tokenpris.

Hva Anthropic faktisk hevder

Anthropic skriver at et Anthropic-medlem ba Claude om å «ta et reelt stikk» på Riemann-hypotesen. Modellen klarte ikke hovedproblemet. I stedet fant den en kombinasjon av eksisterende matematisk arbeid som, ifølge selskapet, gir en bedre nedre grense for andelen zeta-nullpunkter som tilfredsstiller hypotesen. Resultatet bygger tungt på tidligere forskning fra blant andre Baluyot, Goldston, Suriajaya, Turnage-Butterbaugh og Bombieri.

Dette er viktig presisjon. Claude «oppfant» ikke matematikk i et vakuum. Den arbeidet innenfor et etablert forskningsfelt, brukte tidligere resultater og satte dem sammen på en måte Anthropic mener gir et nytt resultat. To matematikere hos Anthropic studerte og validerte arbeidet. Brian Conrey og Dan Goldston undersøkte også papiret på kort varsel. Claude produserte dessuten en formelt verifiserbar Lean-formalisering av resultatet.

Det er fortsatt ikke det samme som full fagfellevurdering over tid. En leder bør lese dette som et sterkt forskningssignal, ikke som en ferdig industri-standard. Nettopp derfor er saken interessant: Anthropic viser både kapasiteten og kontrollbehovet. Modellen fant et spor. Mennesker måtte forstå, validere og forklare det.

Agentmønsteret er viktigere enn mattehistorien

Metoden bak funnet er nesten mer relevant enn resultatet. Anthropic oppgir at Claude brukte to økter i Claude Code og totalt 31 millioner output-tokens. Første forsøk genererte rundt 650 ideer uten gjennombrudd. I andre forsøk koordinerte modellen omtrent 60 subagenter i halvannet døgn. De kjørte 2 400 shell-kommandoer og skrev hundrevis av Python-skript. Subagentene gjorde numeriske kontroller mot kjente zeta-nullpunkter og vurderte hverandres arbeid.

Dette ligner mindre på chatbot og mer på et forsknings- eller analyseapparat. Det er samme mønster virksomheter nå prøver å bygge for kodebaser, sikkerhetshendelser, finansanalyse, juridisk dokumentgjennomgang og produktutvikling: én modell som ikke bare svarer, men organiserer arbeid over tid.

For CIO-en betyr det at evalueringsgrunnlaget må utvides. Det holder ikke å spørre om modellen kan skrive et godt svar i første forsøk. Man må teste utholdenhet, selvkorrigering, sporbarhet, kostnad, tilgang til verktøy, datahygiene og hvem som godkjenner sluttresultatet. For CISO-en er spørsmålet enda skarpere: 60 subagenter og tusenvis av kommandoer kan være ekstremt produktivt, men også ekstremt risikabelt uten sandkasser, minste privilegium, logging og eksplisitte stoppregler.

Dette er ikke en grunn til å slippe agentene løs

Saken frister til overskrifter om at AI «løser matematikk». Det er feil nivå. Anthropic sier selv at teknikkene ikke forventes å lede direkte til et bevis for Riemann-hypotesen. Det riktige nivået er mer jordnært og mer strategisk: avanserte modeller begynner å bli nyttige i lange, åpne kunnskapsløp der svaret ikke finnes i en fasitliste.

Det endrer hvordan virksomheter bør måle AI. En modell som kan lage en proof-of-concept på fem minutter er nyttig. En modell som kan stå i et halvannet døgn langt løp, prøve hundrevis av hypoteser, dokumentere sporene, produsere kode, foreslå et papir og levere noe mennesker kan kontrollere, er noe annet. Det peker mot en verden der AI ikke bare automatiserer enkeltdeler av arbeid, men deltar i selve forsknings-, utviklings- og kontrollprosessen.

Den gode nyheten er at dette kan øke kapasiteten i smale ekspertmiljøer dramatisk. Den dårlige nyheten er at styringsmodellen må være voksen. Hvis agenten kan gjøre reelle faglige funn, kan den også gjøre reelle feil med stor selvtillit og stort volum. Da blir governance, sikker kjøring, revisjonsspor og uavhengig review like viktige som modellvalg.

Lederpoenget

Dette er en tydelig påminnelse om at neste fase av modellkonkurransen ikke bare handler om hvem som slipper en raskere modell. Den handler om hvem som kan koble modell, verktøy, subagenter og verifikasjon til arbeid som faktisk tåler kontroll.

For norske virksomheter er praktisk lærdom enkel: begynn å evaluere AI på full arbeidsflyt, ikke bare på svar. Be leverandørene vise hvordan modellen feiler, hvordan den dokumenterer forsøk, hvordan den isoleres fra sensitive systemer, og hvordan menneskelig ekspertgodkjenning skjer før noe får konsekvens. Anthropic-saken er fascinerende matematikk. For ledere er den mest av alt en varsellampe: agentisk AI er i ferd med å bli for kapabel til å styres som en vanlig chatbot.

Kilder og medier

Primærkilde: Anthropic, https://www.anthropic.com/research/riemann-zeta

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.