Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

OpenAI lover teknisk rapport etter Hugging Face-hendelse • Anthropic gjør Claude Opus 5 til ny toppmodell for agentarbeid • Falske AI-plugins stjal utviklernes API-nøkler • AI-agentpakker på npm ble kapret i 27 minutter • Beijing tvinger Meta til å reversere Manus-kjøp

Black Forest Labs lanserer FLUX 3 som multimodal grunnmodell
AI-modellerMultimodal AIVideo AIRobotikkOpen weights

Black Forest Labs lanserer FLUX 3 som multimodal grunnmodell

JH
Joachim Høgby
24. juli 202624. juli 20265 min lesingKilde: Black Forest Labs

Black Forest Labs har lansert FLUX 3 i early access. Det er ikke bare enda en bildemodell. Selskapet posisjonerer FLUX 3 som en multimodal grunnmodell for bilde, video, lyd og handlingsprediksjon i samme arkitektur.

Det er et tydelig skifte fra FLUX 1 og FLUX 2, som i praksis var mest kjent som sterke modeller for bildegenerering. Med FLUX 3 prøver Black Forest Labs å gjøre modellen til en mer generell representasjon av hvordan verden ser ut, beveger seg og høres ut. Den korte versjonen: modellen skal ikke bare lage medier, men lære nok fysikk og sammenheng til at samme backbone også kan brukes i robotikk og produksjonsmiljøer.

For CIO-er og produktledere er dette interessant av tre grunner. Først: multimodal produksjon blir mer samlet. I stedet for separate modeller for bilde, video og lyd peker FLUX 3 mot én modellfamilie som kan generere og redigere flere medier med felles kontekst. Deretter: video blir mer strategisk enn før, fordi video tvinger modellen til å håndtere tid, årsak, vekt, bevegelse og kontinuitet. Til slutt: handlingsprediksjon gjør dette relevant langt utenfor markedsavdelingen. Hvis modellen faktisk kan koble visuell forståelse til handling, er det en bro mot fysisk AI, simulering og industriell automatisering.

Black Forest Labs sier at FLUX 3 er trent på bilder, video og lyd samtidig. Selskapet beskriver dette som et steg mot «real-world visual intelligence»: modeller som kan oppfatte, forutsi og handle på tvers av digitale og fysiske miljøer. Det er store ord, men de er mer substansielle enn vanlig lanseringsspråk fordi selskapet også legger frem en konkret utrullingsplan.

Først ut er FLUX 3 Video i early access. Modellen skal kunne lage video med lyd i opptil 20 sekunder i én generering. Funksjonene som trekkes frem inkluderer tekst-til-video, bilde-til-video, video-til-video, generativ video- og lydfortsettelse, keyframe-til-video, flerspråklig dialog og støtte for ulike stiler og sideforhold. Black Forest Labs sier også at modellen kan kjede enkeltklipp sammen til lengre sekvenser, og at karakterkonsistens kan støttes med visuelle referanser.

Samtidig varsler selskapet flere faser. FLUX 3 Image kommer i early access de neste ukene. Deretter følger bilde- og videoredigering via API-er og private vekter, handlingsprediksjon gjennom utvalgte forsknings- og kommersielle partnere, raske varianter for billigere iterasjon, og etter hvert open-weight tilgang til en multimodal backbone under navnet FLUX 3 Dev. Det siste er viktig. Hvis BFL faktisk leverer en åpen multimodal ryggrad for video, lyd, bilde og handling, kan det gi utviklere og virksomheter mer kontroll enn lukkede kreative API-er vanligvis gir.

Den mest uvanlige delen er robotikksporet. Black Forest Labs skriver at en tidlig versjon av FLUX 3 allerede kjører på roboter. Sammen med mimic robotics har de laget FLUX-mimic, en video-action-modell bygget på FLUX 3-backbonen og mimic sin kompetanse på robotlæring og produksjonsutrulling. Ifølge selskapets egen blogg er løsningen testet og tatt i bruk på roboter hos Audi for fingerferdig manipulasjon og produksjonsoppgaver.

Det betyr ikke at alle bedrifter bør starte et robotprosjekt mandag morgen. Men det betyr at grensene mellom kreative modeller, simuleringsmodeller og modeller for fysisk handling blir mindre ryddige. En modell som lærer video godt nok, må lære noe om kontakt, bevegelse, tyngde og konsekvens. Det er nettopp slike mønstre industri, logistikk, opplæring og vedlikehold forsøker å modellere.

For ledere er den praktiske vurderingen enkel: ikke kjøp hype, men følg arkitekturen. Hvis multimodale modeller samles rundt én backbone, vil plattformvalg, datatilgang og rettighetsstyring bli viktigere enn enkeltfunksjoner. Markeds- og designteam vil se det først gjennom bedre video, lyd og bildeproduksjon. Operasjonelle miljøer kan få effekten senere gjennom simulering, visuell inspeksjon, prosessopplæring og robotikk.

Det er også risikopunkter. Early access betyr at produktet ikke er modent nok til bred drift. BFL omtaler egne evalueringer som foreløpige og forventer videre forbedringer. Virksomheter bør derfor teste FLUX 3 mot egne krav til rettigheter, datasikkerhet, merkevarestyring, kvalitet og kost per ferdig leveranse. For produksjonsbruk må det i tillegg avklares om API, private vekter eller senere open-weight-varianter passer best til styringsmodellen.

Likevel er FLUX 3 en av de mer interessante modellnyhetene akkurat nå. Ikke fordi den lover penere video alene, men fordi den peker mot en modelltype som kan bruke bilde, video, lyd og handling som ulike signaler om samme verden. Det er mer strategisk enn enda en promptboks med bedre estetikk.

Kilder og medier

  • Primærkilde: Black Forest Labs, https://bfl.ai/blog/flux-3
  • Modellside: https://bfl.ai/models/flux-3
  • Offisiell X-kunngjøring: https://x.com/bfl_ai/status/2080308988961554582
  • Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.