Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face • Bloomberg: NVIDIA-kunder varsles om over 15 prosent prishopp på AI-servere • OpenAI kutter GPT-5.6 Sol mer enn 20 prosent – i tre måneder

Meta AIRA₃ tar Kaggle-gull: live med GPT-5.5 og Claude, ikke Muse
AI-modellerMetaAIRAAI-agenterNemotronNVIDIAKaggleMuse SparkCIOCISOEval

Meta AIRA₃ tar Kaggle-gull: live med GPT-5.5 og Claude, ikke Muse

JH
Joachim Høgby
5. september 20265. september 20265 min lesingKilde: AI at Meta

Meta la 5. september fram resultatet av et live-eksperiment med AIRA₃, labens neste generasjon autonome forskningsagenter. I juni gikk systemet inn i en Kaggle-konkurranse drevet av NVIDIA. Oppgaven var å finjustere en 30B Nemotron-modell slik at den resonnerte bedre. Alle lag fikk samme informasjon. Rangeringen skjedde eksternt, på et skjult testsett.

AIRA₃ endte på 8. plass av rundt 4000 lag og tok gull. Meta skriver at systemet slo menneskelige konkurrenter som hadde tilgang til de samme frontier-verktøyene, og kaller det et pålitelig signal om at AIRA₃ kan løfte en avgrenset modelegenskap på nivå med menneskelige eksperter.

Det er ikke en ny modell-lansering. Det er en eval av et agentsystem. AIRA₃ er ikke sluppet. For CIO og CISO er tre fakta viktigere enn medaljen: live-vinneren kjørte ikke Metas egen modell, arkitekturen er en sverm uten sentral styring, og dere kan ikke kjøpe systemet.

Live-ensemblen var OpenAI og Anthropic

Meta er tydelig på modellvalget. Gullplassen i den live konkurransen kom fra et ensemble av GPT-5.5 med OpenCode og Claude 4.8 med ClaudeCode. Muse Spark 1.2 med MuseCode ble først testet i etterkant, på samme private testsett, og traff også gullnivå. Muse Spark 1.1 og GLM 5.2, begge med OpenCode, traff sølv.

Det betyr at Metas forskningsagent i skarpt felt brukte rivalenes modeller og kodeharness, ikke Muse Spark 1.3 som laben nylig har gjort allment tilgjengelig i Muse Code og Meta Model API. 1.3 er en annen sak. Her er 1.2 et etterhåndsfunn, ikke live-vinneren.

For innkjøp er poenget enkelt. Når en lab hevder at «vårt agentsystem» tar gull, spør hvilken modell som faktisk kjørte, om resultatet er live eller replay, og om harnessen er OpenCode, ClaudeCode eller egen stakk. Samme agentramme kan se sterk ut med én leverandør og middelmådig med en annen. Pris, dataflyt og avtaleverk følger modellen, ikke pressemeldingen om medaljen.

Ingen sentral kontroller, delt filsystem

AIRA₃ kjører mange langvarige agenter, par av modell og kodeharness, i isolerte miljøer. De koordinerer asynkront via to felles flater: et forum for hypoteser og funn, og et delt filsystem for løsningsartefakter. Meta understreker at det ikke finnes en sentral kontroller. Søkestrategier oppstår dynamisk når hver agent velger hvilke funn den bygger videre på.

Isolasjon uten sentral styring er et kjent mønster i forskningsagenter. Det er også en kjent angrepsflate. Agenter som deler filer og hypoteser kan forsterke feil like raskt som de forsterker funn. En CISO som vurderer lignende oppsett internt, må behandle forumet og filsystemet som produksjonsflater. Hvem kan lese artefaktene. Hvor lenge de lever. Om agentene kan hente eksterne vekter, laste opp adapters, eller skrive ut av isolasjonen. Metas melding sier isolert. Den sier ikke hvordan isolasjonen er håndhevet, logget eller reversert.

Forgjengeren AIRA₂ ligger åpent som forskningskode og er målt på MLE-bench. AIRA₃ er foreløpig en X-tråd og en labdemo, ikke et repo dere kan installere.

27 prosent lavere latenstid, og en leirtavle

Meta hevder at AIRA₃ generaliserer ved å bytte oppgavespesifikasjon. Internt skal systemet ha kuttet latenstid med 27 prosent på produksjons-GPU-kjerner. I en annen Kaggle-konkurranse skal det ha nådd gullnivå på oversettelse av 4000 år gamle akkadiske leirtavler til engelsk.

Begge tallene kommer fra Meta, uten offentlig metode, baseline eller tidsbruk. De er retningsgivende, ikke reviderbare. Kaggle-gullet på Nemotron er sterkere fordi rangeringen skjedde eksternt. De interne GPU-tallene er det ikke.

Martin Josifoski i Meta Superintelligence Labs kaller det, så vidt han kjenner til, det første gullet vunnet av et autonomt AI-forskningssystem. Meta rammer det inn som et skritt mot rekursiv selvforbedring. Formuleringen er labens. Den er ikke et produktløfte, og den er ikke et bevis på at AIRA₃ kan forbedre seg selv uten menneskelig oppgavevalg, compute og evalueringsdesign. Meta sier selv at de er tidlig ute, og at harde problemer gjenstår.

Kostnaden er udekt. Forgjengeren AIRA₂ er beskrevet med tung GPU-kjøring. En sverm av frontier-modeller med kodeharness er ikke AutoML for et lite klassifiseringsproblem.

Hva norske ledere bør gjøre

Tre spørsmål hører hjemme i ledergruppen, ikke i en modellkatalog.

Først: skillet mellom modell og harness. Meta vant live med GPT-5.5 og Claude 4.8. Muse Spark 1.2 traff gull i ettertid. Hvis virksomheten kjøper Muse Code eller Meta Model API fordi AIRA₃ tok gull, kjøper den feil objekt. Gullplassen er et systemresultat. Kontrakten må spesifisere modell, harness, isolasjon og om replay er tillatt i leverandørens dokumentasjon.

Deretter: agenter som forbedrer modeller. Oppgaven var å lære en 30B Nemotron å resonnere bedre. Det er presist det interne ML- og plattformteamet vil bli bedt om å automatisere. Hvis slike svermer får tilgang til treningsdata, adapters og produksjonskjerner, er det en endringsprosess mot modellvekter, ikke en chat. Endringskontroll, godkjenning av adapters og tilbakerulling må ligge på plass før noen lar agentene kjøre over helgen.

Til slutt: rekursiv selvforbedring som styringsord. Et system som bygger videre på egen kunnskap uten sentral kontroller er nyttig i et Kaggle-løp. I bank, helse eller offentlig sektor er det en ny klasse av uovervåket endring. Styret trenger ikke å avgjøre om dette er AGI. Styret trenger å avgjøre om noen i virksomheten allerede kjører svermer mot kode, GPU-kjerner eller åpne konkurranser uten at CISO ser filsystemet.

Kilder og medier

Primærkilde: AI at Meta, X-tråd 5. september 2026: https://x.com/AIatMeta/status/2096271545589190927

AI at Meta, live-ensemble og etterhåndstester: https://x.com/AIatMeta/status/2096271547229167748

AI at Meta, forum og delt filsystem: https://x.com/AIatMeta/status/2096271550517575918

AI at Meta, generalisering og rekursiv selvforbedring: https://x.com/AIatMeta/status/2096271554237936107

Martin Josifoski, Meta Superintelligence Labs: https://x.com/MartinJosifoski/status/2096304852611608983

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.