Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

SoftBank: 10 mrd. dollar i junk-papir – OpenAI-tranche 1. oktober • OpenAI-agenter rammet RubyGems: over 2000 pakker – kalt godartet • Anthropic: Claude-bruddene var alignment-feil, ikke bare sandbox • Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs

Cognition SWE-2: nær Fable på PR-er, bak Astra på hard agentkode
CognitionSWE-2DevinAI-modellerKodeagenterCIOCISOFinOpsKimi K3Open Weights

Cognition SWE-2: nær Fable på PR-er, bak Astra på hard agentkode

JH
Joachim Høgby
10. september 202610. september 20265 min lesingKilde: Cognition

Cognition lanserte 10. september SWE-2, den nyeste kodeagentmodellen i Devin. Selskapet kaller den sin mest avanserte hittil. Pitch: 50,0 prosent på FrontierCode 1.1 Main, innen ett poeng av Anthropics Fable 5.1, og 64 prosent billigere. Tilgangen er Devin Desktop og CLI. Web og Fusion rulles ut. Cognition har ikke lagt ut vekter og ikke åpnet et frittstående API.

For en CIO er det to spørsmål. Først: holder Pareto-påstanden utenfor Cogs egen tabell. Deretter: hva koster det å låse kodeagenten til Devin, når basen er Moonshots åpne Kimi K3 på 2,8 billioner parametre.

Hva som faktisk er nytt

SWE-2 er post-trent fra Kimi K3, ikke trent fra bunnen. Cognition skriver at de for første gang skalert forsterkningslæring inn i multi-billion-parameter-regimet, på infrastrukturen fra SWE-1.7. Nyheten i oppskriften er én RL-kjøring som trener alle innsatsnivåer (medium, high, max) samtidig, med en lineær kostnadsstraff per nivå. Straffen er satt til den lokale helningen på basemodellens Pareto-kurve.

Innsatsnivåene er produktet. Medium skal ta enkle og mellomstore oppgaver billig. High og max skal planlegge mer, lese mer av kodebasen og verifisere hardere. På FrontierCode 1.1 Main sier Cognition at SWE-2 medium scorer høyere enn SWE-1.7, med 58 prosent færre turer og 81 prosent lavere gjennomsnittskostnad. Første reelle edit kommer etter median 18 steg, mot 48 for SWE-1.7.

Selskapet beskriver tre atferdsskift internt: bedre ende-til-ende-tester, mer ressursbruk innenfor brukerens tilganger når den åpenbare veien er stengt, og mer re-derivering når den utfordres. Det er internobservasjoner, ikke tredjepartsrevisjon.

Tallene Cognition selv oppgir

Disse er leverandørens egne målinger. Appendix A sier at de bruker offentlig tall der det finnes. Ellers kjører de modellen i harnesset den primært er utviklet for: Claude Code for Anthropic, Codex for OpenAI, Grok Build for xAI, Devin CLI for åpne vekter. For hver modell rapporteres beste score på tvers av innsatsnivå.

FrontierCode 1.1 Main: SWE-2 50,0. Fable 5.1 50,9. GPT-6 Astra 53,3. GPT-5.6 Sol 47,5. Grok 4.6 48,0. Kimi K3 44,2. SWE-1.7 42,0.

DeepSWE 1.1: SWE-2 73,0. Astra 74,1. Sol 72,7. K3 68,5. Fable 5.1 67,4.

Terminal-Bench 2.1: SWE-2 92,8. Fable 5.1 91,4. Astra 89,9. Sol 88,8.

Terminal-Bench 4: SWE-2 27,3. Astra 57,9. Fable 5.1 55,8. Sol 37,3. K3 21,5. SWE-1.7 7,6.

Gapet på Terminal-Bench 4 er saken. SWE-2 er nær Fable på Cogs egen PR-benchmark og sterk på TB 2.1. På den hardere agentbenken ligger den omtrent halvparten av Astra og Fable. Cognition sier selv at high og max holder et forsprang på komplekse oppgaver. Tabellen viser likevel at «nærmest frontier» ikke gjelder den tøffeste raden.

Kostnadstallene er også Cogs. 64 prosent billigere enn Fable 5.1 på FrontierCode. Innen noen poeng av Astra til om lag en fjerdedel av prisen. Ingen uavhengig priskalkyle er lagt ved. Ingen tokenpris for et åpent API, fordi det ikke finnes.

Hva som mangler

Ingen modellkort med kontekstvindu, cutoff eller offentlig parameterantall for SWE-2 selv. Basen Kimi K3 er 2,8T. SWE-2 er proprietær og kjører inne i Devin.

Ingen frittstående API. Ingen ruting via OpenRouter eller egen gateway. Byttet fra Cursor, Claude Code eller Codex er et plattformbytte, ikke et modellbytte.

FrontierCode er Cogs egen benchmark for om en menneskelig maintainer ville merget en AI-skrevet PR. Den er nyttig. Den er ikke nøytral. Når SWE-2 lander ett poeng bak Fable der, og 30 poeng bak på Terminal-Bench 4, bør innkjøp lese begge rader.

Tillit og Kina-basen

Cognition rerørte to tillitstester fra en tidligere post om modeller avledet av åpne vekter. På propaganda og sensur, 145 spørsmål om politisk sensitive tema i Kina, i engelsk, forenklet kinesisk og tradisjonell kinesisk, fikk SWE-2 98,0 prosent pass totalt (99,8 engelsk, 95,2 forenklet kinesisk, 99,1 tradisjonell). Dommeren er GPT-5.6 Luna. Det er Cogs ramme, ikke en uavhengig Kina-audit.

På kontekst-avhengig sårbarhet i koding, med ulike kundeidentiteter og språk, fant de ingen statistisk signifikant økning i sårbar implementasjon for noen av de seks modellene i suiten. Nyttig som negativt funn. Det erstatter ikke egen red team mot Devin i deres repoer.

K3-linjen er CISO-saken. SWE-2 er amerikansk post-trening på en kinesisk åpen base. Vektene for SWE-2 er ikke ute. Data som går gjennom Devin, går gjennom Cogs kjøretid, ikke gjennom Moonshot. Likevel: opphavet, lisenslinjen og eventuelle eksport- og innkjøpsregler for kinesiske vekter må inn i leverandørvurderingen før Devin blir standard for kildekode.

Hva dette betyr for ledergruppen

SWE-2 er et kostnadsargument inne i Devin, ikke et nytt felles modell-API. Team som allerede betaler for Devin, får en sterkere intern modell med tre innsatsnivåer. Team som vil bytte modell uten å bytte IDE, får ingenting å kalle.

FinOps: medium mot max er den reelle priskontrollen. Cognition trener bevisst hele kurven. Hvis utviklerne kjører max som standard, forsvinner 81-prosent-kuttet mot SWE-1.7.

CISO: ingen åpne vekter å scanne. Ingen egen vekt-hosting. Dere arver Cogs sandbox, logging og dataplane. Kjør samme sårbarhetstester mot Devin som mot andre kodeagenter. Ikke les 98 prosent på Cogs Kina-eval som godkjenning for regulert kode.

Kjøp: be om oppgavene der Terminal-Bench 4-gapet vises i deres stack. Lange, fler-repo, uklare spesifikasjoner. Hvis Devin bare vinner på PR-er som ligner FrontierCode, er SWE-2 en billig mergefabrikk, ikke en erstatning for Fable eller Astra på de harde agentløpene.

Kilder og medier

Primærkilde: Cognition, «Introducing SWE-2: Pushing the Pareto Frontier», 10. september 2026. https://cognition.com/blog/swe-2

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.