NVIDIA kutter DeepSeek-V4 Pro oppstartstid fra 8 minutter til under 2 med ModelExpress
NVIDIA publiserte 24. juli 2026 en teknisk gjennomgang av ModelExpress (MX), en ny komponent i Dynamo-inferensplattformen som dramatisk reduserer oppstartstiden for svært store modeller. Den praktiske demonstrasjonen er tydelig: DeepSeek-V4 Pro, en av de tyngste åpne modellene med 806 GB vekter, startet opp på 1 minutt og 44 sekunder mot tidligere 8 minutter – en forbedring på nær 5 ganger.
Dette er ikke bare en akademisk optimalisering. Oppstartstid er en direkte driftskostnad i produksjon: hver gang en ny replika spinnes opp – ved skalering, rullerende oppdatering eller restart – betaler infrastrukturen for ventetid. For modeller i trillion-parameterklassen har denne kostnaden vært en praktisk barriere for fleksibel horisontal skalering.
Hva er ModelExpress og hvordan virker det?
ModelExpress er bygd rundt én kjerneidé: spør alltid om en kompatibel kopi av modellvektene allerede finnes et sted i klyngen, og bruk den raskeste tilgjengelige overføringsstien i stedet for å laste fra fjernlagring hver gang.
Systemet har tre prioriterte stier:
- GPU-til-GPU RDMA via NIXL (raskest): Hvis en eksisterende replica allerede kjører modellen med vektene i GPU-minnet, overfører NVIDIA Inference Xfer Library (NIXL) vektene direkte mellom GPU-er over InfiniBand eller RoCE uten å gå via CPU, PCIe eller hosteminnet. Ny replika blir deretter selv en kilde for neste replika – det er en fan-out-mekanisme som akselererer horisontal skalering eksponentielt.
- Streaming fra objektlagring (bootstrap): Når ingen peer finnes, streamer ModelExpress fra S3 eller Hugging Face via en multitrådet tensor-leser direkte inn i GPU-minnet uten å mellomlagre på lokal disk. I tensor-paralleloppsetninger deles nedlastingsansvaret mellom nodene.
- GPUDirect Storage (GDS) fra lokal lagring: Leser checkpoint-filer direkte fra disk til GPU-minnet uten å passere hosteminnet, ved hjelp av NVIDIAs GDS-backend i NIXL.
Kontrollplanet bruker Redis, Kubernetes CRDs eller Serverless metadata-backends for å oppdage kompatible peers basert på en unik model signature som inkluderer vekter og runtime-konfigurasjon. Selve vektdataene håndteres kun på dataplanet.
Konkrete tall fra DeepSeek-V4 Pro
NVIDIA bruker DeepSeek-V4 Pro (TP=8 på vLLM-motor) som referansemodell gjennom artikkelen:
- Oppstartstid total: Fra 8 minutter (tradisjonell kald start) til 1 minutt 44 sekunder med MX og P2P RDMA
- NIXL-minneregistrering: VMM arena-strategi gir lavest registreringskostnad for de titusener av tensorer en slik modell inneholder
- Ingress-effektivitet: Uten MX vil 10 samtidige replika-forespørsler laste ned 8 TB identisk data; MX koordinerer ett felles nedlastingsforløp
De samme teknikkene gjelder også for RL post-training: ModelExpress distribuerer oppdaterte vekter fra treningsnodene til inferens-workers uten at de trenger å lagre til disk mellom hver iterasjon.
Hvorfor dette er relevant for enterprise og AI ops
For teknologiledere og AI-driftsteam er dette relevant på minst tre nivåer:
1. Kostnader ved horisontal skalering Med MX betaler du i praksis kun én kald oppstart per modell per cluster, og deretter en brøkdel av den kostnaden per ny replika via GPU-til-GPU fan-out. For teams som kjører store open-weight modeller i produksjon – som DeepSeek-V4, Llama-klassen eller fremtidige Qwen 3-varianter – betyr dette at autoscaling-strategier kan justeres vesentlig ned i latens og opp i frekvens.
2. Rullerende oppdateringer og RL post-training Selskaper som bruker kontinuerlig RL-finjustering i produksjon (reward-basert justering på live trafikk eller domenespesifikke tilbakemeldinger) har hittil møtt en praktisk flaskehals: modellvektene må distribueres til inference-workers mellom hver treningsrunde. ModelExpress fjerner mye av denne friksjon via direkteoverføring.
3. Lavere inngangsterskel for store åpne modeller En av de faktiske barrierene mot å kjøre multi-hundre-GB modeller i egne klynger er oppstartstid og infrastrukturkompleksitet. En 5x forbedring her er ikke marginal – det er forskjellen mellom en modell som er praktisk å drifte og en som ikke er det.
Åpen kildekode og tilgjengelighet
ModelExpress er en del av NVIDIA Dynamo, som er tilgjengelig som åpen kildekode. NIXL-biblioteket er også åpent. Teknologien støtter pluggbare transport-backends (InfiniBand, RoCE, NVLink, EFA) og integrerer med vLLM og andre inferens-rammeverk. Implementasjonen er hardware-agnostisk i sin kjerne, med plattformspesifikke hurtigstier aktivert automatisk ved deteksjon.
Artikkelen er forfattet av fem ingeniører fra NVIDIA Dynamo-teamet og publisert i NVIDIAs Technical Blog.
Kilder og medier
Kilde: NVIDIA Technical Blog — https://developer.nvidia.com/blog/modelexpress-distributing-model-artifacts-at-the-speed-of-light/
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.