NVIDIA åpner Sol-H3: MiniMax-H3 under avspillingstid på 8× B300
NVIDIA Research, Efficient AI Team og Singapore-laben, slapp 7. september Sol-H3: en helstabel som kjører MiniMax-H3 raskere enn avspilling på én 8× NVIDIA B300-maskin. MiniMax bekreftet nyheten samme dag. Det er ikke en ny basemodell. Det er en åpen inferensmotor rundt vektene som allerede ligger ute.
På 8× B300 måler de 5 sekunder video med native stereo-lyd, 1344×768 og 24 fps, på 1,653 sekunder. Ti sekunder tar 3,732 sekunder. Femten sekunder tar 6,612 sekunder. Mot 50-stegs Base H3 Dense er det 11,04×, 13,57× og 15,05×. På 4× B300 når 15-sekundersklippet 15,54×. På én B300 tar fem sekunder 13,745 sekunder. Der er du ikke under avspillingstid.
For norske ledere er skillet mer verdifullt enn headline. Farten er reell på oppgitt jern. Den er ikke en SLA, og den er ikke Fal H3 Max.
Hva NVIDIA faktisk sammenligner
NVIDIA skriver det selv: profilene er ulike. Base H3 bruker 50 scheduler-punkter, 49 DiT-forwards. Sol-H3 bruker fire DiT-forwards og FastH3 Preview v1, en few-step LoRA. Det er ikke bare sparse attention på samme sampling. Standardprofilen prioriterer fart og er tapsutsatt. Dense-oppmerksomhet brukes på 1× B300. SOL med INT8 QKV og FP8-uttransport brukes på 4× og 8×.
Målingen er median av tre kjøringer etter én oppvarming, samme prompt og seed 20260903, referansefri tekst-til-video-og-lyd. Tiden inkluderer tekstkoding, DiT-denoising og VAE-dekoding. Den ekskluderer modellasting, kompileringsoppvarming og ferdig MP4-enkoding. Bruk tallene som lab-måling på B300, ikke som sammenligning mot Fal, SGLang eller MiniMax sitt eget API uten å lese fotnoten.
Sol-H3 er Sol-Engine pluss Sol-Attn. Motoren holder modellen varm og styrer kjerner, kommunikasjon over åtte GPU-er, kompilering og dekoding. Sol-Attn velger attention-blokker mens modellen kjører, uten omskolering av vektene. Seks grep er dokumentert: dynamisk sparse attention, fusjonerte kjerner for norm, RoPE og MLP, pakket 8-GPU-utveksling, fusjonert sparse-oppsett (1,206 ms ned til 0,285 ms), parallell VAE-dekoding (7,55 s ned til 0,602 s på femsekundersklipp) og forhåndsberegnet AdaLN som frigjør om lag 24 GB per GPU.
Støtte: tekst-til-video, første-ramme bilde-til-video og Ref2VA. Few-step LoRA-er til MiniMax-H3 kan plugges inn i samme runtime. Koden er Apache 2.0. Vektene og tredjepartskomponenter beholder egne vilkår. Det skillet må inn i innkjøpet: du kan kopiere runtime. Du kopierer ikke automatisk modellrettighetene.
Åpen stabel, dyrt jern, stengt alternativ
Hogby dekket 29. august Fal H3 Max: fem sekunder under tre sekunder, stengt API, ettertrent derivat. Sol-H3 er den andre aksen. NVIDIA åpner stabelen. MiniMax-vektene er åpne. Hastighet under avspilling for femsekundersklippet krever likevel 8× B300, fire samplingsteg og kvantisert kommunikasjon.
For CIO er spørsmålet hvilken kontrakt som følger farten. Lokal Sol-H3 gir kontroll og lisensklarhet på koden, mot capex og drift på Blackwell. Fal H3 Max gir API-latens uten at du eier derivatet. MiniMax sitt eget endepunkt er fortsatt referansen for 2K og omni-referanse, ikke for lavest mulig latens.
CISO må lese gjennomstrømningen. Fem sekunder ferdig audio-video på 1,65 sekunder på én node endrer økonomien for deepfake, merkevareklipp og innhold som ser live ut. Logging, vannmerking, samtykke og retensjon hører hjemme i innkjøpet, ikke som vedlegg etter første demo. Standardprofilen er tapsutsatt. Hvis merkevare og juridisk krever at utdata matcher 50-stegs dense, er 11×-tallet irrelevant.
Neste steg NVIDIA peker på, er kontinuerlig 24 fps-strømming og interaktiv oppdatering uten å restarte sesjonen. Det er forskningsretning, merket som kommende. Ikke budsjetter det som kapasitet dere har i dag.
Test Sol-H3 der dere allerede har MiniMax-H3 og B300, med syntetiske merkevarer og uten persondata. Ikke bytt styrt merkevareproduksjon mot en 4-stegs lab-demo. Farten er reell på oppgitt jern. Kvalitetsavtalen er det NVIDIA ikke har signert for dere.
Kilder og medier
Primærkilde: NVIDIA Research, «Sol-H3: Speed-of-Light MiniMax-H3 on an 8× NVIDIA B300 Blackwell System», 7. september 2026: https://nvlabs.github.io/Sana/Sol-Engine/Sol-H3/
MiniMax, offisiell bekreftelse på X, 7. september 2026: https://x.com/MiniMax_AI/status/2097006566696444363
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.