Nous gjør LongCat 2.0 til praktisk agenttest
Nous Research åpnet i går LongCat 2.0 fra Meituan LongCat gratis i Nous Portal i én uke. Det høres først ut som en kampanjepost. Det er mer interessant enn som så. Når en 1,6 billioner parameter MoE-modell med 1 million token kontekst flyttes fra modellkort og entusiasttråder til en tilgjengelig portal, blir den plutselig testbar for vanlige teknologiteam.
Det er den reelle nyheten for norske ledere: ikke at enda en modell finnes, men at en svært stor åpen-vektsmodell for agentisk koding kan prøves i faktiske arbeidsflyter uten at teamet først må bygge egen inferensrigg. Det senker friksjonen for å teste om lang kontekst faktisk gir bedre kodeforståelse, bedre repo-endringer og færre agentfeil.
Hva som er nytt
Nous sier at LongCat 2.0 er gratis i Nous Portal i én uke. Posten peker på tre harde egenskaper: 1,6 billioner totale parametere, 1 million token kontekst og agentisk koding som hovedbruk. Den oppgir også 70,8 på Terminal-Bench 2.1 og at modellen kan lese en hel kodebase i én passering.
Meituans eget modellkort på Hugging Face gir mer teknisk kontekst. LongCat 2.0 er en Mixture-of-Experts-modell med rundt 48 milliarder aktive parametere per token. Den bruker LongCat Sparse Attention for lang kontekst, N-gram embedding for bedre parameterutnyttelse og er post-trent mot kode- og agentoppgaver. Modellkortet oppgir også MIT-lisens for vektene og advarer, fornuftig nok, om at modellen ikke er evaluert for alle nedstrømsbruk.
Det siste punktet er viktig. Åpen vekt betyr ikke automatisk lav risiko. Det betyr at virksomheter får mer kontroll over kjeden, men også mer ansvar for testing, sikkerhet, databehandling og drift.
Hvorfor CIO og CISO bør bry seg
Lang kontekst er blitt en strategisk snarvei i AI-markedet. Hvis en modell faktisk kan lese store deler av en kodebase, kontraktssamling eller intern dokumentstruktur i én omgang, endrer det hva en agent kan gjøre. Den trenger færre oppslag, mister mindre sammenheng og kan potensielt planlegge bedre på tvers av filer og systemer.
Men det er også her mange modellnyheter blir PR-ræl. En million token på papiret er ikke det samme som presis beslutning over en million token. Den praktiske testen er om modellen finner riktig fil, skjønner gamle avhengigheter, gjør små nok endringer og stopper når den mangler sikker kontekst. LongCat 2.0 bør derfor vurderes på agentkvalitet, ikke bare rå benchmarktall.
For CISO er dette et relevant spor fordi åpne eller mer kontrollerbare modeller kan redusere leverandørlås og datalekkasjer, men bare hvis de kjøres med streng policy. Kodeagenter får ofte tilgang til repo, miljøvariabler, CI, tickets og dokumentasjon. En modell med lang kontekst og gode agentegenskaper er nyttig, men den er også nærmere operativ makt. Tilgangsstyring, audit-logg og sandboxing blir ikke mindre viktig fordi modellen er imponerende.
Hva lederteam bør teste
Ikke start med en demo der modellen får skrive en ny app fra blankt lerret. Det beviser lite. Start med tre realistiske oppgaver fra egen drift.
Først: la modellen lese et mellomstort repo og forklare de fem viktigste risikoområdene før den får endre noe. Se om den faktisk peker på riktige moduler, gamle migrasjoner, testsvakheter og integrasjonsgrenser.
Deretter: gi den en liten bug med tverrfilavhengighet. Mål om den lager en minimal patch, oppdaterer tester og unngår tilfeldig refaktorering. Lang kontekst er bare verdifull hvis endringen blir smalere, ikke større.
Til slutt: kjør en nekt-test. Be agenten gjøre noe den ikke har mandat til, for eksempel lese hemmeligheter, endre deployoppsett eller slette data. En god agentstack skal stoppe før modellen får makt til å gjøre skade.
Strategisk vurdering
LongCat 2.0 viser hvor raskt modellmarkedet flytter seg fra ren chat til agentinfrastruktur. Store kinesiske åpne modeller, amerikanske portaler og globale kodeharnessere begynner å møtes i samme arbeidsflate. Det gir kjøpere flere valg, men også et mer krevende evalueringsarbeid.
Det riktige spørsmålet er ikke om LongCat 2.0 slår GPT, Claude eller Gemini i én tabell. Det riktige spørsmålet er om modellen gir et bedre kost/kontroll-forhold for konkrete agentoppgaver: repo-forståelse, refaktorering, dokumentanalyse og produksjonsnær feilsøking.
For de fleste virksomheter er dette ikke en umiddelbar standardmodell. Det er en testkandidat. Men en god en. Gratisvinduet i Nous Portal gjør at teknologiledere kan kjøre en ærlig 2-timers vurdering før leverandørmøtene og hypegrafene tar over. Litt kjedeligere. Mye nyttigere.
Kilder og medier
Primærkilde: Nous Research, https://x.com/NousResearch/status/2087970618167706023
Teknisk modellkort brukt som verifiserende kontekst: Meituan LongCat på Hugging Face, https://huggingface.co/meituan-longcat/LongCat-2.0-INT8
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.