Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Microsoft lanserer cybermodell som kutter agentkost • NVIDIA og Microsoft åpner AI-sikkerhetsallianse • WSJ: Nvidia forhandler 250 milliarder dollar i garantier for OpenAI-datasenter • OpenAI lover teknisk rapport etter Hugging Face-hendelse • Anthropic gjør Claude Opus 5 til ny toppmodell for agentarbeid

Vercel viser prislappen på AI-drevet sårbarhetsjakt
CISOCIOCybersikkerhetAI-modellerKodeSårbarhetshåndteringEnterprise AI

Vercel viser prislappen på AI-drevet sårbarhetsjakt

JH
Joachim Høgby
28. juli 202628. juli 20264 min lesingKilde: Vercel

Vercel har publisert DeepsecBench, en benchmark for AI-modeller som leter etter sikkerhetssårbarheter i applikasjonskode. Den viktigste lærdommen er ikke at én modell leder. Det viktigste er at sårbarhetsjakt med AI er i ferd med å bli et kostnads- og porteføljevalg for sikkerhetsledere.

Benchmarken kommer i kjølvannet av OpenAIs egen testhendelse, der modeller i en isolert evalueringssituasjon fant en sårbarhet, kom seg ut på internett og nådde Hugging Face sin produksjonsdatabase. Den hendelsen har allerede vist hvorfor AI-sikkerhet ikke kan behandles som vanlig statisk kodeanalyse med litt bedre språkforståelse.

DeepsecBench forsøker å gjøre spørsmålet mer målbart: Hvilke modeller finner faktiske feil, hvor mange falske funn lager de, hvor lang tid tar det, og hva koster det?

Lavere pris, fortsatt begrenset dekning

Vercel skriver at benchmarken kjører på en åpen kildekodebase i en tilstand rett før et større antall sårbarheter ble fikset. Selskapet valgte 50 inngangsfiler og bygget et sett med 231 menneskevurderte funn. Modellenes poengsum er en recall-vektet F2-score, der manglende funn teller tyngre enn falske positive.

Det er riktig prioritering for sikkerhet. Et falskt positivt funn koster tid. En oversett sårbarhet kan bli stående i produksjon.

Resultatene er samtidig en god kalddusj. Toppresultatet, GPT-5.6 Sol på xhigh, får 35,58 poeng, finner 71 av 231 kjente funn og bruker 3 timer og 39 minutter til en kostnad på 55,98 dollar. Claude Opus 5 på medium ligger på 28,36 poeng, 57 funn, 47 minutter og 31,96 dollar. Kimi K3 på high får 17,56 poeng for 12,38 dollar. Grok 4.5 på high får 15,58 poeng for 5,60 dollar.

Med andre ord: Dette er nyttig, men ikke magi. Selv beste kjøring finner 30,7 prosent av de kjente sårbarhetene. AI-skanning kan gi flere øyne på kodebasen, men den kan ikke erstatte grunnleggende sikkerhetsarbeid, threat modeling, dependency-kontroll, review og hendelsesrespons.

CISO får en ny modellportefølje

Det strategiske poenget ligger i kostnadskurven. Vercel anslår at en produksjonskodebase kan være omtrent hundre ganger større enn benchmarkens 50 filer. Da kan en full Kimi K3-runde koste rundt 1 200 dollar, mens toppmodellen fra OpenAI kan passere 5 000 dollar for en dypere kjøring.

For CISO-er betyr dette at spørsmålet ikke blir «skal vi bruke AI til sikkerhet?». Spørsmålet blir hvor ofte, på hvilke kodeområder, med hvilke modeller og med hvilken oppfølging.

En fornuftig modell kan være lagdelt. Billigere modeller kan kjøre oftere på store deler av kodebasen. Dyrere frontiermodeller kan reserveres for kritiske komponenter, betalingsflyt, autentisering, intern plattformkode og kode som eksponerer kundedata. Funn må inn i vanlig sårbarhetsstyring, ikke bli liggende som enda et dashboard.

Dette passer også med en bredere utvikling i markedet. Microsoft lanserte nylig MAI-Cyber-1-Flash for å kutte kostnaden i agentbasert sikkerhetsarbeid. NVIDIA og partnere peker på åpne sikkerhetsharnesser. Vercels tall viser hvorfor: volumet av kode og angrepsflate er for stort til at bare dyreste modell kan brukes overalt.

Benchmarken må ikke bli ny komfortpute

Det er flere forbehold. Vercel er en leverandør med egne sikkerhetsprodukter og egen interesse i å definere hvordan scanning bør kjøpes og måles. Benchmarken holder også repo, commit, filer og funn hemmelige for å unngå trening og lekkasje. Det er metodisk forståelig, men gjør ekstern etterprøving vanskeligere.

For ledere er ikke svaret å styre etter én tabell. Svaret er å bruke slike tall til å bygge en intern evalueringsdisiplin. Ta representative deler av egen kodebase. Mål funn, presisjon, kost, tid og hvor mye arbeid sikkerhetsteamet faktisk sparer. Skill mellom funn som er teknisk korrekte og funn som er relevante for virksomhetens risikobilde.

AI gjør sårbarhetsjakt billigere. Den gjør den ikke gratis, og den gjør den ikke automatisk trygg. Det nye styringsspørsmålet er hvordan sikkerhetsteamet kjøper dekning per krone uten å drukne utviklerne i halvferdige funn.

Kilder og medier

Primærkilde: Vercel, «DeepsecBench: evaluating model performance in finding cybersecurity vulnerabilities», publisert 27. juli 2026. https://vercel.com/blog/deepsecbench-evaluating-model-performance-in-finding-cybersecurity-vulnerabilities

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.