Qwen3.8-Omni-Flash: 1M lyd og video – vektene er stengt
Qwen slipper 18. september Qwen3.8-Omni-Flash, en innfødt omnimodal modell som tar tekst, bilde, lyd og video i samme vindu på 1 million tokens. Laben sier den holder tekstnivået til en like stor tekstmodell, og at snittet over 29 egne evalueringer stiger mer enn 25 prosent mot Qwen3.5-Omni-Plus. Timeprisen for lydinn skal være kuttet mer enn 98 prosent, lyd pluss video mer enn 93 prosent. For CIO er dette møteopptak og videoproduksjon som plutselig blir billig nok til å bli standard. For CISO er det en kinesisk API-flate mot rå møtevideo, med agenter som kan sende e-post og starte koding. Vektene er ikke ute.
Hva Qwen faktisk lanserer
Qwen3.8-Omni-Flash er ikke et nytt språkflaggskip. Det er neste native omni-modell, bygget for å gå fra å forstå innhold til å planlegge, kalle verktøy og levere ferdig arbeid. Demoene er videoredigering, musikkvideo, filmkommentar, AV-sammendrag og sanntidssamtale.
Tilgang er Qianwen AI-plattformen og Alibaba Cloud Model Studio. Modell-ID i API er qwen3.8-omni-flash. Inndata: tekst, bilde, lyd og video. Utdata: tekst. Tale ut ligger fortsatt på Qwen3.5-Omni. Tenking er på som standard. Funksjonskall og nettsøk er med. Kontekst er 1 million tokens, maks ut 131 072.
En sanntidsvariant, Qwen3.8-Omni-Flash-Realtime, tar levende AV-strømmer og kaller verktøy underveis. Qwen kaller den den første omnimodalen som kan lokalisere mål etter lyd. Qwen-MM-Plugins utvides for lange AV-løp. Qwen-Live Harness er tenkt som åpen kjøretid for kontinuerlig omni-interaksjon.
Tallene som skal bære påstanden
Alle hovedtall er labens egne. WildClawBench-MM, multimodal verktøybruk: 71,0 mot 34,5 for forrige Omni og 58,9 for Gemini 3.8 Flash. UniClawBench: 69,6, et hår foran Geminis 69,0. AgenticVBench: 36,8 mot Geminis 45,0. OmniGAIA med nettsøk: 74,0 mot 78,6. Gemini leder fortsatt flere AV-forståelsesbenker, blant annet OmniVideoBench 65,2 mot 63,4 og Video-MME-v2 71,0 mot 65,0.
Der Qwen er tydelig sterkere, er flersnakker-ASR. På AliMeeting faller DER og cpWER fra 88,11 og 89,61 til 3,35 og 17,18. AISHELL-4 lander på 2,8 og 11,2. LongAudioSpan treffer 82,7 i nøyaktighet. På OmniVideoBench i agentmodus stiger treffsikkerheten fra 63,4 til 67,8 mens tokenbruken faller omtrent 45,7 prosent.
Tekst er ikke ofret. SWE-bench Pro: 63,3. CoWorkBench: 75,3. LiveCodeBench v6: 92,6. GPQA Diamond: 91,0. Det er Qwens egne harnessvalg, ofte Claude Code, og flere celler mot Claude Opus 4.6 er tomme eller lab-evaluert på nytt. Ta det som retning, ikke innkjøpsfasit.
I et 12-timers forsøk lot de modellen forbedre Qwen2.5-Omni-3B på sichuanesisk tale. Tegnfeilraten falt fra 25,79 til 15,30 prosent, omtrent 40,7 prosent relativ kutt, over fire runder og 3 413 treningseksempler. Det er et internt R&D-eksperiment, ikke et produkt dere kan kjøpe.
Tilgang, region og det som mangler
Alibaba Cloud lister regioner i Beijing, Singapore, Hongkong, Tokyo, Frankfurt og Virginia. Frankfurt er den eneste åpenbare EØS-enden. Det er ikke det samme som europeisk suveren modell. Databehandler er fortsatt Alibaba. Ingen åpne vekter i denne lanseringen. Dere kjører ikke Omni-Flash i eget stativ.
Prisene oppgis som relative kutt, ikke som dollar per million tokens i bloggposten. Metoden er 30 ganger inn-kostnaden for to minutter kildemateriale, 720p ved 1 bilde i sekundet for AV. Gemini er priset med høy mediaoppløsning. Uten absolutte satser i RFP-en blir «98 prosent billigere lyd» et markedstall, ikke et budsjett.
Hva det betyr for ledergruppen
Tre beslutninger.
Først: arbeidsflate. En modell som ser møtevideo, skiller talere, lager referat, plukker aksjonspunkter og kan sende e-post eller starte koding, er ikke en transkripsjonstjeneste. Den er en ny databehandler mot det mest sensitive dere har i kalenderen. Skru av agenthandlinger til policy, DLP og menneskelig godkjenning er på plass.
Deretter: leverandør. Qwen treffer Gemini 3.8 Flash på flere AV-benker og slår den på lyd, ifølge Qwen. Gemini leder fortsatt agent-video og flere forståelsesmål. Dere kjøper ikke «beste omni». Dere kjøper en billig kinesisk AV-agent med Frankfurt som mulig endepunkt og uten lokal vektfil.
Til slutt: evidens. 29 evalueringer, egne harness, egne priskutt. Be om dataflyt, retention, underleverandører og om møtevideo kan trene videre. Si nei til produksjon på rå styre- og kundesamtaler til det ligger i kontrakten.
Kilder og medier
Primærkilde: Qwen, «Qwen3.8-Omni-Flash: Omni Senses. Agentic Delivery.», 18. september 2026: https://qwen.ai/blog?id=qwen3.8-omni-flash
Bekreftet i Alibaba Cloud Model Studio-dokumentasjon for qwen3.8-omni-flash, oppdatert 17. september 2026.
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.