Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

OpenAI lover teknisk rapport etter Hugging Face-hendelse • Anthropic gjør Claude Opus 5 til ny toppmodell for agentarbeid • Falske AI-plugins stjal utviklernes API-nøkler • AI-agentpakker på npm ble kapret i 27 minutter • Beijing tvinger Meta til å reversere Manus-kjøp

Poolside åpner stor kodeagentmodell for lokal drift
AI-modellerAI-agenterKodeagenterOpen weightsPoolsideCIOCISOUtviklerverktøy

Poolside åpner stor kodeagentmodell for lokal drift

JH
Joachim Høgby
23. juli 202623. juli 20265 min lesingKilde: Poolside

Poolside har sluppet Laguna S 2.1, en åpen modellfamilie laget for agentisk koding og lengre utviklingsoppgaver. Dette er ikke enda en generell chatbot-lansering. Det interessante er at modellen er bygget for å jobbe i verktøykjeder, holde ut over mange steg, sjekke eget arbeid og kjøre nærmere virksomhetens egne miljøer.

Kortversjonen: Laguna S 2.1 er en Mixture-of-Experts-modell på 117,6 milliarder totale parametere, med 8,5 milliarder aktive parametere per token. Poolside beskriver den som laget for agentic coding og long-horizon work. NVFP4-varianten er rundt 71 GB, støttes i blant annet vLLM, SGLang, Transformers og NVIDIA TRT-LLM, og kan brukes via plattformer som OpenRouter og Vercel AI Gateway. Den kommer under OpenMDW-1.1-lisens, med vekter på Hugging Face.

Det gjør saken relevant for ledere av to grunner. Først: kodeagenter er i ferd med å flytte fra demo til produksjonsnær drift. Da betyr det noe om modellen kan kjøres, testes, begrenses og observeres i en kontrollert teknisk arkitektur. Dernest: åpne vekter gir virksomheter en annen forhandlingsposisjon enn rene API-modeller. Det betyr ikke automatisk lavere risiko, men det gir flere valg i sikkerhet, databehandling, kost og leverandørstyring.

Poolside peker særlig på agentisk oppførsel. Modellen skal ikke bare svare med kode, men jobbe mer som en utvikleragent: bruke verktøy, resonnere mellom kall, verifisere resultater og fortsette når oppgaven krever mange runder. Det er akkurat her mange kodeagenter feiler i praksis. De ser flinke ut i første svar, men mister disiplin når oppgaven blir lang, avhengigheter skifter, tester feiler eller repoet krever konkret forståelse.

På modellkortet rapporterer Poolside flere kode- og agentbenchmarks: 70,2 prosent på Terminal-Bench 2.1, 78,5 prosent på SWE-bench Multilingual, 59,4 prosent på SWE-Bench Pro og 40,4 prosent på DeepSWE. Slike tall må leses som leverandør- og benchmarkinformasjon, ikke som en innkjøpsbeslutning. Likevel peker de på riktig konkurranseflate: ikke ren tekstkvalitet, men evnen til å få utviklingsarbeid gjort i et faktisk verktøymiljø.

For CIO er hovedspørsmålet derfor ikke om Laguna S 2.1 er “best”. Det er om åpne kodeagenter nå er gode nok til at virksomheten bør ha en lokal eller semi-lokal strategi ved siden av de store sky-API-ene. Svaret begynner å bli ja for flere brukstilfeller: kodeanalyse, migrering, testgenerering, intern dokumentasjon, modernisering og agentarbeid i repoer der datagrunnlaget er sensitivt eller kommersielt viktig.

For CISO er saken mer dobbel. Åpne vekter kan redusere avhengighet og gi bedre kontroll med dataflyt, logging og kjøreflate. Samtidig flyttes ansvar inn i egen organisasjon. Modellen må pakkes inn med rettighetsstyring, policy, sandboxing, repo-tilgang, secrets-beskyttelse, logging, evals og tydelige stoppregler. En kodeagent som får bred tilgang til kildekode, terminal og CI/CD er ikke et produktivitetsverktøy alene. Den er en privilegert aktør i utviklingsmiljøet.

Det mest interessante med Laguna S 2.1 er derfor ikke parameterstørrelsen. Det er kombinasjonen av åpen lisens, relativt lav aktiv parameterbruk, lang kontekst og verktøyrettet trening. Standardkonfigurasjonen i modellkortet er 262 144 tokens kontekst, mens vektene beskrives som native 1M-checkpoints med mulighet for 1 048 576 tokens ved endring i konfigurasjon, med forbehold om kvalitetsfall. For store kodebaser er det strategisk viktig. Mer kontekst kan bety færre brutte antakelser, bedre migreringsplaner og mindre manuell liming mellom filer, issues og testfeil.

Men dette er ikke en invitasjon til å slippe modellen løs i produksjon. Første steg bør være et lukket eval-løp mot egne repoer: gamle bugs, pull requests, migreringsoppgaver, testdekning og sårbarhetsfunn. Mål tid spart, feilrate, sikkerhetsbrudd, hemmelighetslekkasje, hallucinerte API-er og hvor ofte agenten må stoppes. Sammenlign mot eksisterende leverandører og mot interne utviklere med AI-støtte.

Hvis modellen skal inn i en virksomhetsplattform, bør den behandles som en komponent i en agentarkitektur, ikke som en enkeltmodell. Det betyr egne gates for hvilke filer den kan lese, hvilke kommandoer den kan kjøre, hvor den kan skrive, når menneske må godkjenne, og hvordan endringer spores. Dette er kjedelig arbeid. Det er også forskjellen på et eksperiment og et verktøy en CISO kan leve med.

Laguna S 2.1 viser hvor fort åpne kodeagenter blir mer praktiske. Ikke fordi alle nå bør bytte ut Claude Code, Codex, Cursor eller interne løsninger. Men fordi markedet får et sterkere alternativ for virksomheter som trenger mer kontroll enn en ren ekstern API-modell gir. For nordiske selskaper med regulert data, eldre kodebaser og stramme leverandørkrav er det akkurat den retningen som er verdt å følge.

Anbefalt ledergrep: sett opp en liten, hard eval. Ikke en demo. Velg fem reelle utviklingsoppgaver fra de siste seks månedene, kjør Laguna S 2.1 i en begrenset agent-harness, og mål resultatet mot dagens arbeidsflyt. Hvis modellen gir stabil gevinst uten å bryte sikkerhetsrammene, har dere et nytt forhandlingskort. Hvis ikke, har dere i det minste lært hvor moden lokal kodeagentdrift faktisk er.

Kilder og medier

Primærkilde: Poolside, “Introducing Laguna S 2.1” - https://poolside.ai/blog/introducing-laguna-s-2-1

Modellkort og vekter: Hugging Face, poolside/Laguna-S-2.1-NVFP4 - https://huggingface.co/poolside/Laguna-S-2.1-NVFP4

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.