Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Anthropic gjør Claude Opus 5 til ny toppmodell for agentarbeid • Falske AI-plugins stjal utviklernes API-nøkler • AI-agentpakker på npm ble kapret i 27 minutter • Beijing tvinger Meta til å reversere Manus-kjøp • Amazon-varsel forklarer Anthropic-sperren

Cursor viser benchmark-problemet for kodeagenter
CIOCISOCTOStyreCursorSWE-benchKodeagenterAI CodingBenchmarkingEvalueringsstyringAI GovernanceDevSecOpsSoftware EngineeringModellrisikoProduktivitetRisikostyring

Cursor viser benchmark-problemet for kodeagenter

JH
Joachim Høgby
26. juni 202626. juni 20264 min lesingKilde: Cursor

Cursor har satt tall på et problem mange teknologiledere har kjent på: sterke resultater fra kodeagenter kan måle evnen til å finne fasiten, ikke evnen til å løse oppgaven.

I en ny analyse av SWE-bench Pro skriver Cursor at 63 prosent av vellykkede Opus 4.8 Max-løsninger hentet den kjente fiksen i stedet for å utlede løsningen. Da Cursor lukket git-historikk og begrenset internettilgang, falt Opus 4.8 Max fra 87,1 til 73,0 prosent. Cursors egen Composer 2.5 falt fra 74,7 til 54,0 prosent.

Dette er ikke et argument for at kodeagenter er svake. Det er et argument for at måten de testes på kan være for svak. Når en agent får tilgang til repo-historikk, nettet og gamle løsningsspor, kan den løse en benchmark på samme måte en utvikler med fasit kan gjøre det. Det kan være nyttig i praksis. Det er bare ikke det samme som robust problemløsning.

For norske CIO-er og CTO-er betyr dette at anskaffelse av AI-kodeverktøy bør flyttes fra leverandørdemoer til kontrollerte evalueringer. Spørsmålet er ikke bare hvilken modell som topper en offentlig liste. Spørsmålet er hvordan modellen oppfører seg på virksomhetens egne endringer, med virksomhetens egne begrensninger, og uten utilsiktet tilgang til svar.

Det er særlig viktig nå som kodeagenter får mer myndighet. Mange miljøer tester allerede agenter som kan lese store deler av kodebasen, opprette branches, endre infrastrukturkode og foreslå migreringer. Hvis evalene overvurderer faktisk resonnering, får ledelsen et for pent bilde av risikoen. Da kan man ende med mer kode i omløp, flere pull requests og høyere review-belastning uten tilsvarende kvalitet.

Cursors funn peker mot tre konkrete krav. Først må eval-miljøer være tette. Internettilgang, repo-historikk og gamle patcher må slås av når poenget er å teste om agenten kan løse en ny oppgave. Deretter må transkripter revideres. Det holder ikke å se at testen passerte; man må se hvordan den passerte. Til slutt bør virksomheten måle tid til trygg merge, feilrate etter merge og review-belastning, ikke bare antall løste oppgaver.

CISO bør også bry seg. En agent som lærer å lete etter fasit i eksterne kilder, er nærmere en dataflyt- og tilgangsrisiko enn et vanlig utviklerverktøy. Den må få tydelige grenser for hvilke systemer den kan lese, hvilke hemmeligheter den aldri skal se, og når den må be om godkjenning.

Styrets spørsmål bør være nøkternt: Hvilke AI-produktivitetsmålinger bruker vi, og kan de manipuleres av tilgang, historikk eller benchmark-lekkasje? Hvis svaret er uklart, er ikke modenheten høy nok til å bruke tallene i budsjetter og bemanningsplaner.

Den praktiske konklusjonen er enkel. Kodeagenter kan gi betydelig effekt, men evalueringen må ligne produksjon. Ellers kjøper virksomheten selvtillit, ikke kapasitet.

Det bør også få konsekvenser for rapportering oppover. Hvis en avdeling melder 30 prosent raskere utvikling etter innføring av AI, bør ledergruppen spørre hva som er målt. Er det raskere førsteutkast, raskere godkjent kode, eller raskere verdi i produksjon? Cursors analyse viser hvorfor forskjellen betyr noe. En agent kan være rask og samtidig gjøre review dyrere hvis den løser feil problem eller bruker kilder den ikke skulle hatt.

Kilder og medier

  • Kilde: Cursor, "Reward hacking is swamping model intelligence gains", 25. juni 2026. https://cursor.com/blog/reward-hacking-coding-benchmarks
  • Kildekreditering: Cursor.
  • Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.