Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face • Bloomberg: NVIDIA-kunder varsles om over 15 prosent prishopp på AI-servere • OpenAI kutter GPT-5.6 Sol mer enn 20 prosent – i tre måneder

MiniMax åpner H3 for omnimodal video-AI
Breaking
AI-modellerMultimodal AIÅpne vekterVideo AIAI-styring

MiniMax åpner H3 for omnimodal video-AI

JH
Joachim Høgby
14. august 202614. august 20264 min lesingKilde: MiniMax

MiniMax har åpnet H3, selskapets omnimodale videomodell, og det er mer enn enda en generator for korte klipp. Modellen er laget for å forstå tekst, bilder, video og lyd i samme kontekst, og genererer video med native stereo-lyd. Det flytter konkurransen fra ren bildekvalitet til komplette audiovisuelle arbeidsflyter.

Den korte versjonen for ledere: dette er et tegn på at åpen modellstrategi nå også treffer video, ikke bare tekst og kode. H3 er ikke en liten demo. MiniMax beskriver den som et 33 milliarder parameter tett system med H3-Omni-Transformer, egne visuelle og lyd-VAE-er, og to åpne basevarianter for først/siste-bilde-til-video og referansebasert audio-video. Outputen er 4 til 15 sekunder, 24 FPS, 32 kHz stereo og 768p som lokal base. 2K-flyten finnes, men er avhengig av deler som fortsatt ligger i MiniMax sin API- og orkestreringsstabel.

Det viktigste er arkitekturen. H3 forsøker å gjøre det bedrifter egentlig vil ha: gi modellen en blanding av tekst, produktbilder, tidligere film, lydreferanser og instruksjoner, og få tilbake en ferdig liten scene med bilde og lyd som henger sammen. Det er en annen klasse enn verktøy som først lager video, så musikk, så voiceover, så klipper alt sammen etterpå. Når modellen håndterer forholdet mellom modalitetene i én pipeline, kan arbeidsflyten bli kortere, billigere og mer repeterbar.

For markedsavdelinger og produktteam er dette fristende. Produktvideoer, e-handel, annonser, opplæringssnutter og interne forklaringsfilmer er alle områder der kostnaden ofte ligger i koordineringen mellom folk og verktøy, ikke bare i selve renderingen. En modell som kan ta flere referanser samtidig, følge mer komplekse instruksjoner og generere lyd sammen med video, kan presse ned produksjonstiden kraftig.

Men dette er også der CIO og CISO må være våkne. H3 er markedsført som åpen, men den praktiske styringsmodellen er mer nyansert. MiniMax har åpnet H3-Base-vektene for videre utvikling og finjustering, mens H3-Context-IR og H3-Regenerate-2K ikke er fullt åpnet i samme slipp. Selskapet tilbyr API-er for å validere og gjenskape deler av den offisielle flyten. Det betyr at en virksomhet kan få lokal kontroll over deler av modellen, men fortsatt være avhengig av hosted logikk hvis den vil matche hele 2K-opplevelsen.

Det er ikke nødvendigvis et problem. Det er bare ikke det samme som full suveren kontroll. Innkjøp og sikkerhet bør derfor skille mellom tre spørsmål: kan vi kjøre basevektene selv, kan vi bruke modellen kommersielt under lisensen vår, og kan vi reprodusere den offisielle kvaliteten uten å sende materiale gjennom en ekstern API? Hvis svaret varierer mellom disse tre, må løsningen behandles som en hybrid, ikke som ren lokal AI.

Lisens og rettigheter blir særlig viktige fordi dette handler om mer enn tekst. Video med stemme, lyd, ansikter, produktbilder og merkevarer har langt større rettighetsflate. MiniMax beskriver automatiske sikkerhetsfiltre og moderering for tekst, bilder og video i hosted flyt, men kundens ansvar for lovlig bruk forsvinner ikke. For norske virksomheter betyr det at interne regler for samtykke, personvern, brand safety og tredjepartsrettigheter må inn i selve produksjonsløypen, ikke bare i en juridisk sjekkliste etterpå.

Den strategiske vinkelen er likevel positiv: åpne multimodale modeller gjør det mer realistisk å bygge egne kreative produksjonsmotorer. Ikke nødvendigvis fordi alle skal fintrene H3 selv, men fordi åpne vekter gir bedre mulighet til benchmarking, lokal testing, integrasjon og kostnadspress mot lukkede leverandører. Når video-AI får en åpnere base, blir leverandørvalget mindre binært: enten full SaaS eller ingenting.

H3 peker også mot en større endring i agentarbeid. Kreative agenter trenger ikke bare skrive brief og lage tekst. De må hente produktkontekst, forstå merkevare, velge referanser, produsere forslag, kontrollere output, loggføre kilder og eskalere det som krever menneskelig godkjenning. En omnimodal modell som H3 kan bli en del av en slik kjede, men den bør ikke få være hele kjeden alene. Kontrollplanet rundt modellen blir like viktig som modellen selv.

For ledelsen er anbefalingen enkel: test H3 som kapabilitet, ikke som leketøy. Start med ufarlige interne konsepter og mål tre ting. Hvor mye reduseres produksjonstid? Hvor lett er det å gjenskape et godkjent uttrykk? Hvor robust er kontrollen på input, output, rettigheter og lagring? Før de tre svarene er gode, bør modellen ikke kobles rett på kundevendte kampanjer eller materiale med sensitive personer og merkevarer.

H3 er dermed en sterk nyhet, men ikke fordi alle bedrifter må bytte videostack denne uken. Nyheten er at åpen multimodal video med lyd nå blir praktisk nok til at seriøse virksomheter må ha en mening om den. Det vil påvirke kost, tempo og governance i kreativ produksjon, opplæring og produktkommunikasjon. De som bare ser dette som «AI-video» mister poenget. Dette er starten på mer agentstyrt innholdsproduksjon med langt flere modaliteter i samme beslutningsløype.

Kilder og medier

Primærkilde: MiniMax, https://www.minimax.io/news/minimax-h3-open-source

Supplerende verifisering: MiniMax H3-modellkortet på Hugging Face beskriver tilgjengelige checkpoints, modellstørrelse, lisens og lokale kjørebaner.

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.