Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

OpenAI dots: Astra 24/7 – Pro stengt i EØS, 4000 apper • AISI: Astra 29 prosent – falsk identitet, payload utenfor scope • OpenAI-agenter: 16 500 UNCTAD-skann – XSS-spill, 82 rate-limits • OpenAI: DNS-hull – pause i trening av de mest kapable • OpenAI-agenter la ut 53 brukerbilder – kan ikke varsle ofrene

Claude Science: ni loops – 1–2 000 dollar, Dixon bekreftet
AnthropicClaudeCIOCISOAI-modellerFableEvalueringFoU

Claude Science: ni loops – 1–2 000 dollar, Dixon bekreftet

JH
Joachim Høgby
25. september 202625. september 20265 min lesingKilde: Anthropic

Anthropic slapp 25. september et gjesteinnlegg på Science-bloggen: Fable 5.1, i harnesset Claude Science, regnet ut den ni-loops MHV-heksagonamplituden i plan N=4 super-Yang-Mills. Forrige menneskelige rekord i leketøysmodellen var åtte loops, satt av Lance Dixon og kolleger ved SLAC. Kostnaden laben oppgir er 1–2 000 dollar per metode, stort sett modelltid. Dixon bekreftet svaret. For CIO i FoU er dette tempo og budsjett. For CISO er det en agent som fikk kjøre i dagevis med beskjed om å fortsette mens eieren sov.

Hva laben faktisk slapp

Innlegget «Yes, Claude can do Nine Loops» er skrevet av fysikeren og skribenten Matt von Hippel, etter en utfordring han postet 7. august. Han ba AI-selskaper løse et åpent problem i amplitudeologi på akademisk compute: N=8 supergravity til sju loops, eller N=4 super-Yang-Mills til ni. Anthropic tok det siste.

To fysikere i laben, Liam Fitzpatrick og Siddharth Mishra-Sharma, spurte først modellen hvilket problem den mest sannsynlig kunne ta. Deretter én prompt: beregn seks-partikkel (heksagon) amplituden i plan N=4 SYM ved ni loops. Resten var av typen «jeg skal sove i flere timer, fortsett til jeg sier stopp, oppdater hver 4–6 timer».

Claude Science er ikke chat. Det er et betalt harness forskere kan kjøpe. Modellen Anthropic navngir i innlegget er Fable 5.1, ikke Opus 5.5. Resultatet ligger i Dixons etablerte format. Menneskene, Dixon og Song He med samarbeidspartnere, skal publisere analysen. Claudes jobb er ferdig.

Tallene som tåler sjekk

To uavhengige stier: klassisk bootstrap og den indirekte formfaktor-metoden Dixon brukte til åtte loops. Hver sti ville kostet en sluttbruker rundt 1–2 000 dollar, mest fordi Fable fikk kjøre så lenge. Bootstrap-delen i Python og SymPy tok omtrent 100 dollar av budsjettet, tilsvarende 96 CPU-er i én uke.

Dixon fikk resultatet 1. september og brukte to uker på validering, mest via ni-loops formfaktor. Han skriver at oppsettet er skjørt: én feil i oppskriften, og det kollapser. Claude måtte skrive koden fra bunnen. Han hevder modellen forstår hans artikler fra 2019 og 2023 bedre enn noen utenfor medforfatterne.

Samtidig: Song He, Jirong Jing og Xiang Li ved det kinesiske vitenskapsakademiet hadde allerede tatt det meste av resultatet, med GPT-6-hjelp på noen constraints, ikke som ett-skudds autonom kjøring. von Hippel understreker at Claude brukte kjente metoder, ikke ny fysikk. Mennesker var også i ferd med å nå det. Det som imponerer ham, er at harnesset kom i mål uten vitenskapelig tilsyn mer sofistikert enn «fortsett».

Hva dette ikke er

Ikke en ny API-SKU. Ikke bevis for superintelligens. von Hippel sier rett ut at han håpet å se nye beregningsmetoder og gikk tomhendt. Anthropic betalte ham for innlegget og ga Dixon Claude-kreditter. Det skal stå i saken.

Leketøysmodellen N=4 er valgt fordi den er lettere enn virkelige partikler. Amplitudeologi for LHC-prediksjoner er et bredere felt med hardere konkurranse. von Hippel advarer mot å generalisere ukritisk, og advarer samtidig mot å anta at det ikke finnes mer lavthengende frukt. I mars beskrev han AI-fysikk som studentnivå med mye håndholding. I september er det frontier-regnestykke for eksperter i feltet.

Leder, CIO, CISO

For FoU-ledere: et frontier-regnestykke som tok eksperter år å nærme seg, ble kjørt på akademisk budsjett i Claude Science. Verifikasjon tok likevel en SLAC-professor to uker. En agent uten menneskelig sjekk er ikke en publiseringsklar rapport.

For CIO: prisen er modelltid, ikke en klynge. 96 CPU-uker er billig. 1–2 000 dollar i Fable-tid er den reelle kostnaden. Claude Science er en betalt flate. Det er ikke det samme som Opus i chat, og det er ikke Mythos bak LSVP-port.

For CISO: dette er langvarig, tilnærmet usupervised agentkjøring med kode og compute. Prompten «fortsett mens jeg sover» er produktmønsteret, ikke et unntak. Samme harness-logikk som i biomodell-kjernene Anthropic viste 17. september. Isolasjon, budsjett, logging og menneskelig validering er styringen. Resultatet er åpent. Metoden er kopierbar.

Ta med: Song He kom i mål med mennesker pluss GPT-6. Fable 5.1 vant på autonomi, ikke på monopol. Den som bygger forskningsagenter uten en Dixon i sløyfen, har et sjekkproblem, ikke et modellproblem.

Kilder og medier

Primærkilde: Anthropic, «Yes, Claude can do Nine Loops», 25. september 2026: https://www.anthropic.com/research/yes-claude-can-do-nine-loops

Resultatfil: Siddharth Mishra-Sharma, ni-loops amplituden i Dixons format: https://smsharma.io/cosmic-nine-loops/

Parallelt menneskelig resultat: Song He, Jirong Jing og Xiang Li, Zenodo: https://doi.org/10.5281/zenodo.22800071

X-kunngjøring: Anthropic, 25. september 2026: https://x.com/AnthropicAI/status/2103541577083719888

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.