Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Anthropic: Claude-bruddene var alignment-feil, ikke bare sandbox • Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face • Bloomberg: NVIDIA-kunder varsles om over 15 prosent prishopp på AI-servere

DeepSeek V4.1-Flash: Flash tar Pro – MIT-vekter, Kina-API
DeepSeekAI-modellerOpen WeightsCIOCISOAPIFinOpsCybersikkerhetAI-agenterKoding

DeepSeek V4.1-Flash: Flash tar Pro – MIT-vekter, Kina-API

JH
Joachim Høgby
10. september 202610. september 20266 min lesingKilde: DeepSeek

DeepSeek lanserte 10. september DeepSeek-V4.1-Flash. Det er den minste modellen i en ny arkitekturfamilie. 552 milliarder parametre MoE. 8 milliarder aktive på input, 16 milliarder på output. Native syn. API-navn: deepseek-flash. Vektene ligger på Hugging Face under MIT.

Selskapet sier Flash nå slår eget flaggskip V4-Pro på ytelse, pris, hastighet og total kjøretid. Fra 14. september 04:00 UTC rutes alle deepseek-v4-pro-kall til Flash, til V4.1-Pro kommer. For team som har pinnet Pro i produksjon, er det et brudd, ikke en notis.

Hva som faktisk er nytt

Arkitekturen heter Causal Encoder-Decoder. 40 lag: 20 encoder, 20 decoder. Decoderens globale KV-cache projiseres fra encoderens siste skjulte tilstand, ikke fra hvert decoderlag. Det er poenget med 8B/16B-asymmetrien: prefill blir billigere, som treffer agentarbeid med lange inn-kontekster.

KV-cachen er 890 byte per token. DeepSeek skriver at det er om lag en fjerdedel av V4-Flash på HBM og en åttendedel på SSD. Cache-hit er ofte den store agentkostnaden. De kutter den.

Vektene er trent fra bunnen på 45 billioner tokens. Kontekst: 1 million tokens. Maks output: 384k. Synskoderen DeepSeek-ViT er trent fra scratch. Lisens: MIT. Filstørrelse på Hugging Face: om lag 510 GB. Det er ikke en laptop-modell. MoE-laget har 1 delt ekspert og 384 rutede, med 6 aktive per token.

Tallene DeepSeek selv oppgir

Disse er leverandørens egne målinger, ikke uavhengig audit.

Terminal-Bench 2.1: 90,6. Foran GPT-5.6 Sol på 88,8, Kimi K3 på 88,3, eget V4-Pro på 87,9 og Anthropic Opus-5.0 på 89,1, ifølge DeepSeek og South China Morning Post.

DeepSWE v1.1: 74,2. CyberGym: 88,1. SEC-Bench Pro: 62,8. ExploitGym: 15,3. GPQA Diamond: 90,9. Codeforces-rating: 3471. Agents' Last Exam: 31,8. AutomationBench: 54,8.

På Terminal-Bench 3.0 og 4.0 ligger Flash bak Opus-5.0 (30,0 mot 43,3 og 31,2 mot 51,8). HLE uten verktøy er 36,8, bak Opus. Dette er ikke en jevn frontier-seier. Det er en effektivitetsmodell som slår over vektklassen på agent- og kodebenker DeepSeek har valgt å fremheve.

API-brudd og pris

Ny modell-id: deepseek-flash. deepseek-v4-flash og deepseek-v4-flash-vision-exp rutes midlertidig hit. V4-Flash og V4-Flash-Vision-Exp er pensjonert.

Pris per million tokens for deepseek-flash, ifølge DeepSeek API-docs, i dollar:

Cache-hit inn: 0,003 lavlast, 0,006 topp. Cache-miss inn: 0,15 lavlast, 0,30 topp. Ut: 0,60 lavlast, 1,20 topp.

V4-Pro ligger flere ganger høyere. Lavlast er halvparten av topp. Topplast er 01:00-04:00 og 06:00-10:00 UTC mandag-fredag. Det treffer norsk formiddag.

Nye priser gjaldt fra 10. september 04:00 UTC. Samtidighetsgrense: 2500 for Flash, 500 for Pro.

WorkBuddy (inkl. CodeBuddy) og OpenCode støtter modellen, ifølge DeepSeek. Inferensstøtte i åpen kilde er planlagt, ikke ferdig levert som drop-in.

Hva dette ikke er

Det er ikke et europeisk API. DeepSeek kjører i Kina. GDPR, AI Act, NIS2 og styrets datalinje er uendret av MIT-lisensen.

Det er ikke bekreftet at Flash slår V4-Pro i deres produksjon. Tallene er DeepSeeks, med egne harness (DeepSeek Harness Minimal, Claude Code-harness på enkelte benker). Reuters bekrefter lanseringen, ikke rankingene.

CyberGym 88,1 og ExploitGym 15,3 er CISO-tall. Åpne vekter under MIT betyr at samme modell kan stå i et rack utenfor DeepSeeks API. Det er forsvarets vindu og angriperens.

552B og 510 GB er et anskaffelsesspørsmål: GPU, lagring, KV-policy, ikke en pip-install.

Hva ledere bør gjøre nå

Pin modell-id. deepseek-v4-pro forsvinner som egen motor 14. september. Test Flash mot deres agent- og kodelaster før routing.

Skill API og vekter. MIT på Hugging Face gir egenhosting og vektorkontroll. API-et gir Kina-jurisdiksjon, logg og underleverandør.

Kjør FinOps mot cache-hit og tidssone. Lange agent-prefill er der 8B-encoderen og 890 byte/token skal betale seg. Norsk kontortid overlapper topppris.

Sett cyber-policy før vektene kommer inn i lab. CyberGym og ExploitGym er ikke grunn til å stenge all kodeassistanse. De er grunn til isolasjon, logging og forbud mot å peke modellen mot produksjon uten mandat.

Ikke bytt ut europeisk eller amerikansk frontier som styrt leverandør uten DPIA. Flash er et kostnadsalternativ og en åpen vekt, ikke en compliance-snarvei.

Kilder og medier

Primærkilde: DeepSeek, «Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient.»: https://www.deepseek.com/en/news/deepseek-v4-1-flash/

DeepSeek API Change Log, 10. september 2026: https://api-docs.deepseek.com/updates

DeepSeek Models & Pricing: https://api-docs.deepseek.com/quick_start/pricing

Hugging Face, deepseek-ai/DeepSeek-V4.1-Flash (MIT): https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash

Reuters, «China's DeepSeek launches V4.1-Flash model», 10. september 2026: https://www.reuters.com/world/asia-pacific/chinas-deepseek-launches-v41-flash-model-2026-09-10/

South China Morning Post, benchmark-dekning, 10. september 2026: https://www.scmp.com/tech/big-tech/article/3367051/deepseek-says-new-flash-ai-model-beats-kimi-k3-cyber-coding-benchmarks

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.