DeepSeek åpner V4-Flash-Vision: 305B under MIT
DeepSeek publiserte 31. august 2026 vektene for DeepSeek-V4-Flash-Vision-Exp på den offisielle Hugging Face-kontoen. Lisensen er MIT. Det er den første eksperimentelle multimodale checkpointen i V4-familien. API-et har vært live siden 21. august. Nå kan dere laste ned, finjustere og kjøre uten å sende bilder til Hangzhou.
For CIO og CISO er dette et jurisdiksjonsskifte, ikke et nytt flaggskip. Synet fantes allerede i API. Det som endrer innkjøpet er at vektene er åpne, lisensen er liberal, og maskinvaren er et flergpu-rack. Tabellen mot Opus 4.8 er DeepSeeks egen. Ingen uavhengig lab har reprodusert den.
Hva som ble sluppet
V4-Flash-Vision-Exp bygger på tekstmodellen V4-Flash-0731. DeepSeek har lagt på visuelle moduler og fortsatt treningen. Hugging Face oppgir 305 milliarder parametre totalt. Tekstkjernen er MoE-en med 284 milliarder totalt og om lag 13 milliarder aktive per token, 43 lag, skjult størrelse 4096, 256 ruteeksperter pluss én delt ekspert, og seks ruteeksperter per token. Konteksten er én million tokener. Maks output i API er 384K.
Modellkortet beskriver image-text-to-text. JPEG, PNG, GIF og WebP. Repositoriet inneholder tokenizer, OpenAI-stil promptkoding, en minimal PyTorch-inferens og oppskrifter for vLLM og SGLang. vLLM-eksempelet kjører på én 4×GB300-node med tensor parallel 4. SGLang bruker DSpark-spekulasjon fra samme checkpoint. Dette er ikke en laptop-modell. Safetensors-vektene ligger rundt 168 GB i 48 shards.
API-koden er deepseek-v4-flash-vision-exp. Prisen er identisk med tekst-Flash: 0,44 dollar per million cache-miss inn og 1,32 dollar per million ut i peak, halvert utenom peak. Cache-hit i peak er 0,014 dollar. Bilder telles som inntokener, inntil 384 per bilde. Tenkemodus er standard. FIM støttes ikke. Chat Completions, Anthropic Messages og Responses API er støttet.
«Exp» betyr at DeepSeek selv merker checkpointen som eksperimentell. En produksjonsstabil visjonsmodell er ikke varslet. Ti dagers API-vindu før vektene kom, skiller slippet fra V4-Flash-0731, der vektene kom samme morgen som API-et i juli.
Tallene er DeepSeeks egne
Labens tabell, kjørt i DeepSeek Harness minimal mode med max reasoning, temperature 1,0 og top_p 0,95, setter Vision-Exp mot V4-Flash-0731 og Opus 4.8.
Tekstagent: Terminal Bench 2.1 83,9 mot 82,7 og 85,0. DeepSWE 59,3 mot 54,4 og 58,0. Toolathlon-Verified 75,9 mot 70,3 og 76,2. NL2Repo 57,7 mot 54,2 og 69,7. DSBench-Hard 63,6 mot 59,6 og 71,7. Cybergym 75,3 mot 76,7 og 78,3, den eneste teksten som faller mot 0731.
Multimodalt: ApexBench Pass@1 36,5 mot 26,2 og 39,4. Agents' Last Exam 27,3 mot 25,2 og 25,7. Chartography 64,3 mot Opus 65,0. ZeroBench Pass@5 35,0 mot 34,0. Fotnoten sier at tekst-0731 ignorerer bildeelementene i ApexBench og Agents' Last Exam. Delen av «spranget» er derfor strukturell. En tekstmodell som hopper over bildet, taper på synsoppgaver uansett hvor sterk teksten er.
Tre av elleve rader slår Opus 4.8, med små marginer. De to hardeste langhorisont-oppgavene, NL2Repo og DSBench-Hard, ligger 12 og 8 poeng bak. Tekstsporet er ikke svekket av synsmodulene: Vision-Exp leder 0731 på seks av sju tekstrader. Behandle tabellen som produsentmåling. Vent på uavhengig lederboard før dere bytter default-modell.
MIT åpner vektene. API-et åpner Kina.
MIT tillater kommersiell kjøring, finjustering og derivater med copyright-varsel. Det er samme spor som GLM-5.3-Flash, som hogby dekket 26. august. To kinesiske laber har nå MIT-lisensierte multimodale MoE-er over 300B i samme uke. Forskjellen er rekkefølgen: Z.ai slapp vekter dag én. DeepSeek lot API-et gå i ti dager først.
Hostet API er noe annet. Prompter og bilder til api.deepseek.com går til DeepSeek i Kina. For regulert sektor i Norge er det sjelden forenlig med databehandlerkrav. Egenhosting fjerner dataflyten. Det fjerner ikke spørsmålet om hva som sitter i vektene, og det fjerner ikke at 305B MoE krever flere GPU-er. GGUF-kvantiseringer sirkulerer rundt 155 GB. Det er innkjøp av rack, strøm og MLOps, ikke en MacBook.
vLLM-støtte for synssporet er fersk. Modellkortet peker på et eget Docker-image. Anta at produksjonsklar inferens krever labens oppskrift, ikke at det «virker i Ollama i ettermiddag». Community-porter som limer en visjonstårn på tekst-0731 er ikke denne checkpointen.
Hva ledelsen bør gjøre
Skill tre spor. Hostet DeepSeek-API for syn er Kina-residens. Egenhostede MIT-vekter er infrastruktur og CISO-godkjenning. Å vente på uavhengig eval er det tredje. Ikke bytt Claude eller GPT på DeepSeeks ApexBench-rad. Ikke bland Vision-Exp med tekst-Flash-0731 i innkjøpsarket. Og ikke les «Exp» som GA.
Hvis dere allerede har sendt skjermbilder og dokumentbilder gjennom API-et siden 21. august, behandle det som data hos DeepSeek. Hvis dere skal PoC-e bak brannmur, budsjetter GPU-er, ikke lisens. Lisensen er den enkle delen. Synet i agentløkker, skjermbilder, diagrammer og UI, er den operative gevinsten. Den kommer først når inferensen faktisk kjører hos dere, med logging, av-knapp og dataklassifisering på plass.
Kilder og medier
Primærkilde: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp Kilde: DeepSeek, modellkort på Hugging Face, 31. august 2026. API-slipp 21. august: https://api-docs.deepseek.com/news/news260821/ Pris: https://api-docs.deepseek.com/quick_start/pricing TechTimes, 1. september 2026: https://www.techtimes.com/articles/326132/20260901/deepseek-open-sources-first-v4-vision-model-benchmark-claims-need-independent-proof.htm Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.