Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

OpenAI holder Zero Data Retention på frontier-modeller • Claude designer proteinbindere autonomt – og laben bekrefter • OpenAI bremser frontier-RL til sikkerheten tar igjen evnene • NVIDIA og OpenAI låser 8 GW AI-fabrikk i Ohio

Gemini Omni Flash gjør video til en styrbar arbeidsflate
ModellerGoogleVideoBenchmarkEnterprise AI

Gemini Omni Flash gjør video til en styrbar arbeidsflate

JH
Joachim Høgby
31. juli 202631. juli 20265 min lesingKilde: Artificial Analysis

Google har fått en ny, konkret lederposisjon i AI-video: Gemini Omni Flash debuterer som nummer én på Artificial Analysis sin Video Editing Leaderboard. Det er ikke bare en kosmetisk seier på en kreativ modelltest. Det peker på en større endring: video går fra å være et ferdig medieformat til å bli en itererbar arbeidsflate, styrt med språk, versjoner og policy.

Artificial Analysis beskriver Gemini Omni Flash som en modell som ikke bare genererer video, men redigerer eksisterende klipp gjennom samtale. Brukeren sender inn en instruksjon, modellen endrer videoen, og neste instruksjon bygger videre på forrige endring via Gemini API sin Interactions API. Det er den viktige delen for virksomheter. Når videoredigering blir flerstegs og samtalebasert, begynner den å ligne mer på kode, design og dokumentarbeid enn på klassisk produksjon.

Modellen leder ifølge Artificial Analysis sin videoredigeringstest foran Alibaba Wan 2.7 og HappyHorse 1.0. Den føyer seg også inn i en sterkere Google-posisjon på video, siden Gemini Omni Flash allerede er rangert høyt på tekst-til-video og bilde-til-video. Testen fremhever spesielt komplekse redigeringer, objektredigering, visuelle effekter og fysikk-/verdenssimulering. Svakere punkter finnes også: audio-kategoriene er ikke like dominerende, og modellen avviser enkelte prompts, særlig der mennesker er involvert.

For CIO-er og CISO-er er dette mer interessant enn en vanlig kreativ modellnyhet. Når markedsavdelingen, opplæringsteamet, HR, salg og internkommunikasjon kan endre video med naturlig språk, flyttes risikoen. Spørsmålet er ikke lenger bare hvem som får bruke et videorederingsverktøy. Spørsmålet blir hvem som får endre ansikter, produkter, språk, omgivelser, logoeksponering og budskap i en allerede godkjent video.

Hvorfor dette treffer enterprise

Google sin modell er oppgitt med output på 720p, 24 FPS og native audio. Artificial Analysis peker også på en pris rundt 0,10 dollar per sekund output, altså omtrent 6 dollar per minutt. Det er billig nok til at videoproduksjon kan bli operasjonell hverdagsvare, men dyrt nok til at feil bruk fortsatt kan bli en budsjettpost. Begge deler betyr at anskaffelse og styring bør gjøres før volumet eksploderer.

Det mest praktiske signalet er ikke bare kvaliteten, men arbeidsformen. Flerturns videoredigering betyr at en bruker kan si: gjør bakgrunnen mer industriell, fjern et objekt, endre lyssetting, bytt språk i tekst eller replikk, og behold resten av scenen. Hvis dette fungerer stabilt nok, blir video en levende mal. Samme produktdemo kan tilpasses bransje, språk, kundegruppe og kanal uten full ny produksjon.

Det er en stor gevinst for markedsføring og enablement. Det er også en klassisk governance-felle. En ferdig video kan ha gått gjennom juridisk, merkevare, produkt og sikkerhet. En AI-redigert variant kan se nesten identisk ut, men ha endret meningen. Små visuelle justeringer kan flytte ansvar: et produkt kan vises i feil miljø, en sikkerhetsfunksjon kan overdrives, et menneske kan fremstilles som å ha sagt eller gjort noe annet, eller en kundereferanse kan få feil kontekst.

Det ledelsen bør gjøre nå

Første tiltak er å skille mellom generering og godkjent publisering. Et team kan godt få eksperimentere med videomodeller, men publiserte videoer bør fortsatt ha eierskap, sporbarhet og godkjenningsløype. Det holder ikke med en generell AI-policy. Video trenger egne regler for personbruk, merkevareelementer, produktpåstander, kundedata, undertekster, dubbing og distribusjon.

Andre tiltak er å kreve metadata og versjonslogg. Når en video endres i flere runder, bør virksomheten kunne se hvilket originalklipp som ble brukt, hvilke prompts som ble kjørt, hvilken modell som endret klippet, hvem som godkjente versjonen, og hvor den ble publisert. Uten dette blir etterkontroll vanskelig når en kampanje, opplæringsvideo eller kundeversjon må spores tilbake.

Tredje tiltak er kostkontroll. 0,10 dollar per sekund høres lavt ut i et enkeltstående eksempel. I et stort salgsteam eller en global markedsorganisasjon kan iterasjoner, A/B-varianter og lokale språkversjoner gjøre video til en ny forbrukspost. Det bør settes rammer på antall genereringer, lengde, godkjente use cases og hvem som kan kjøre dyre batcher.

Fjerde tiltak er leverandørstrategi. Gemini Omni Flash er relevant fordi den ligger i Google-flaten: Gemini API, Google AI Studio, Gemini Enterprise Agent Platform og forbrukerflater som Gemini-appen, Flow og YouTube Shorts. For organisasjoner som allerede bruker Google Workspace eller Vertex/Gemini, kan dette bli en naturlig utvidelse. For Microsoft- eller Adobe-tunge miljøer bør man likevel teste interoperabilitet, eksport, rettighetskontroll og arkivering før man lar innholdsflyten låse seg til én leverandør.

Ikke les testen som ferdig fasit

Artificial Analysis er et nyttig eksternt signal, men benchmarken er ikke en full sikkerhets- eller produksjonssertifisering. Leaderboard-resultatene gjelder vellykkede genereringer, og Artificial Analysis noterer selv at modellen blokkerte noen prompts. Det er bra at filter finnes, men det gjør også målingen mer komplisert: en modell kan se sterk ut på kvalitet for oppgaver den faktisk gjennomfører, samtidig som de mest følsomme oppgavene avvises.

For ledere er konklusjonen enkel: Gemini Omni Flash gjør AI-video mer praktisk, mer styrbar og mer enterprise-nær. Det betyr ikke at alle skal åpne slusene. Det betyr at video bør inn i samme styringsregime som kode, data og merkevarekritiske dokumenter. Den virksomheten som får dette riktig, kan produsere raskere uten å miste kontrollen. Den som behandler det som et nytt leketøy i markedsavdelingen, får en hyggelig demo og en mindre hyggelig revisjon senere.

Kilder og medier

Primærkilde: Artificial Analysis, https://x.com/ArtificialAnlys/status/2082991648703930561

Supplerende kilde: Google AI for Developers, Gemini Omni Flash model documentation, https://ai.google.dev/gemini-api/docs/models/gemini-omni-flash

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.