Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Anthropic: Claude-bruddene var alignment-feil, ikke bare sandbox • Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face • Bloomberg: NVIDIA-kunder varsles om over 15 prosent prishopp på AI-servere

DeepSeek V4 Pro 0813 blir bedre agentmodell, men dyrere i drift
Breaking
AI-modellerDeepSeekOpen weightsAI-agenterCIOCISO

DeepSeek V4 Pro 0813 blir bedre agentmodell, men dyrere i drift

JH
Joachim Høgby
15. august 202615. august 20265 min lesingKilde: Artificial Analysis

DeepSeek V4 Pro 0813 ser sterkere ut der virksomheter faktisk vil bruke modellene: agentisk kunnskapsarbeid, terminaloppgaver, lange arbeidsflyter og kode. Men den gamle DeepSeek-fortellingen om ekstrem verdi har fått en ripe i lakken.

Artificial Analysis har målt den nye 0813-versjonen til 53 på Intelligence Index, åtte poeng over aprilutgaven av V4 Pro. Det høres solid ut. Det er solid. Men det er også bare ett poeng over DeepSeek V4 Flash 0731, som er den billigere og mindre varianten. For ledere som vurderer modellstrategi betyr det én ting: kjøp ikke bare «Pro» fordi navnet høres tryggere ut. Mål arbeidsflyten, ikke merkelappen.

Det mest interessante funnet ligger i agentisk arbeid. På GDPval-AA v2 øker V4 Pro 0813 til Elo 1590, opp 284 poeng fra forrige V4 Pro. Artificial Analysis tolker det som omtrent 84 prosent forventet vinnrate mot aprilmodellen. Modellen jobber også lenger per oppgave, med 39 runder i snitt mot 23 tidligere. Dette peker mot en modell som tåler mer iterasjon, mer verktøybruk og mer trinnvis problemløsing før den gir seg.

For CIO og CISO er dette mer relevant enn en pen totalscore. Agentmodeller feiler sjelden fordi de ikke kan skrive en isolert funksjon. De feiler fordi de mister kontekst, bruker for mange steg, hallusinerer en forklaring, eller gjør feil verktøykall etter ti minutters arbeid. En forbedring i agentisk kunnskapsarbeid er derfor et reelt kjøpssignal. Men det er ikke et blankosjekk-signal.

Prisen endrer regnestykket

DeepSeek oppdaterer prisene 16. august med peak/off-peak-modell. For V4 Pro peker DeepSeeks egen prisside på peak-priser på 1,32 dollar per million inputtokens og 3,96 dollar per million outputtokens. Off-peak halverer dette. Cache-hit-prisen øker også betydelig sammenlignet med tidligere.

Artificial Analysis beskriver dette som en kraftig kostøkning. Cost per Task går fra 0,05 til 0,25 dollar i deres måling, selv om modellen bruker færre tokens. Det er den delen innkjøp bør merke seg. Effektivitet i tokens er bra, men den hjelper mindre hvis leverandøren samtidig flytter prisgulvet.

V4 Pro 0813 bruker 128 millioner outputtokens for å kjøre Intelligence Index, rundt 30 prosent færre enn aprilmodellen. Det plasserer den på en åpenvekts-frontier for intelligens mot tokenbruk. Likevel er det ikke nok til å bevare DeepSeek som like ekstremt kostvåpen som før. Modellen er fortsatt konkurransedyktig, men marginen er tynnere.

Open weights er fortsatt strategisk

DeepSeek V4 Pro 0813 er en åpenvektsmodell med MIT-lisens, 1M kontekstvindu og MoE-arkitektur med 1,6 billioner totale parametere og 49 milliarder aktive. Den er tilgjengelig via DeepSeeks API ved lansering, og vektene ligger tilgjengelig for miljøer som vil eie mer av stakken selv.

Dette er ikke bare en teknisk detalj. For norske selskaper med strenge krav til dataflyt, revisjon, leverandørrisiko og kostkontroll er åpne vekter et forhandlingskort. Du kan teste modellen mot egne oppgaver, kjøre deler lokalt eller hos valgt infrastrukturpartner, og bytte orkestrering uten å rive ut hele applikasjonen.

Men åpen vekt betyr ikke automatisk lav risiko. Agentbruk krever fortsatt logging, policy-gates, prompt- og verktøykontroll, dataklassifisering og klare stoppregler. En modell som nesten aldri avstår fra å svare kan være nyttig i produksjon, men den kan også bli farlig hvis den brukes i arbeidsflater med tilgang til data, kode, kundedialog eller infrastruktur.

Hva bør ledelsen gjøre nå?

Første steg er å splitte evalueringen i tre spor. Ett spor for kvalitet: løser modellen faktiske saker bedre enn dagens modell? Ett spor for kost: hva blir totalpris per fullført arbeidsflyt, ikke per million tokens? Ett spor for styring: kan modellen brukes under eksisterende sikkerhetspolicy uten særbehandling?

DeepSeek V4 Pro 0813 bør spesielt testes i lange agentoppgaver der Flash-modellen hittil har vært nesten god nok, men ikke stabil nok. Hvis Pro bare gir marginal forbedring i enkle oppgaver, er den vanskelig å forsvare. Hvis den derimot reduserer menneskelig etterarbeid i komplekse kode-, analyse- eller saksbehandlingsløp, kan femgangen i målt oppgavekost fortsatt være rasjonell.

Det smarte kjøpet er derfor ikke «bruk V4 Pro overalt». Det er å bruke Pro selektivt: planlegging, vanskelige avklaringer, kodegjennomgang, feilrotanalyse og høyverdige agentsteg. Flash eller andre billigere modeller kan fortsatt ta rutinevolumet. Multi-modell-routing går fra teknisk optimalisering til CFO-relevant kontrollmekanisme.

Konklusjonen er nøktern: DeepSeek har flyttet V4 Pro 0813 tydelig fremover som agentmodell, men samtidig gjort økonomien mindre selvsagt. Det gjør ikke modellen svakere. Det gjør bare innkjøpsjobben mer voksen. Jippi, enda et regneark.

Kilder og medier

Primærkilde: Artificial Analysis, https://x.com/ArtificialAnlys/status/2088440350734201149

Supplerende kilde: DeepSeek API Docs, https://api-docs.deepseek.com/quick_start/pricing

Supplerende kilde: Artificial Analysis model page, https://artificialanalysis.ai/models/deepseek-v4-pro

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.