Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

OpenAI-agenter rammet RubyGems: over 2000 pakker – kalt godartet • Anthropic: Claude-bruddene var alignment-feil, ikke bare sandbox • Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face

Qwen3.8-LiveTranslate: 2,3 s – norsk tale, Singapore-API
QwenAlibabaCIOCISODPOAI-modellerOversettelseEnterprise AILeverandørstyring

Qwen3.8-LiveTranslate: 2,3 s – norsk tale, Singapore-API

JH
Joachim Høgby
18. september 202618. september 20265 min lesingKilde: Qwen

Qwen lanserer 18. september Qwen3.8-LiveTranslate, en egen modell for sanntidstolkning. Laben kutter gjennomsnittlig etterslep (LAAL) fra 2,8 til 2,3 sekunder, og sier troverdighet, flyt og korthet stiger mot forrige generasjon. 60 kildespråk. 29 språk som talt utdata. Norsk ligger i begge listene. For CIO er dette en timepris som kan utkonkurrere menneskelig tolk. For CISO og DPO er det rå møtelyd mot Alibaba Cloud, internasjonalt i Singapore, ikke i EØS.

Hva Qwen faktisk lanserer

Dette er ikke Omni-Flash. Omni tar tekst, bilde, lyd og video og svarer i tekst, med agenter og 1 million tokens. LiveTranslate er en smalere, strømmende tale-til-tale-modell: den hører, oversetter og snakker. Modell-ID i API er qwen3.8-livetranslate-flash-realtime. Transporten er WebSocket.

Arkitekturen er Hybrid-MoE Thinker–Talker. Thinker fletter video, lyd, kildetekst og oversettelse inn i én kausal sekvens. Talker syntetiserer oversettelsen med mer stabilt originalt stemmeleie. Ny i denne runden: sanntids talerseparasjon med setningsvis attribusjon, kilde og oversettelse i samme strøm, og langkontekst som bruker tidligere turer for å holde navn og fagspråk konsistente. Sesjonen kan levere taler-ID og kildetekst uten et eget ASR-kall.

Demo ligger på Qwen Omni. API-dokumentasjon ligger i Alibaba Cloud Model Studio. Ingen åpne vekter. Dere kjører ikke denne i eget stativ.

Tallene som skal bære påstanden

Alle hovedtall er labens egne. LAAL faller fra 2,8 til 2,3 sekunder. På Omnilingua-MSpeaker, 14 språkretninger med flere talere og lang lyd, sier Qwen at modellen slår «dagens mainstream» på troverdighet, flyt, korthet og diariseringsfeil (DER). På offentlig FLEURS, 70 språkretninger, leder den forrige generasjon og de samme rivalene på oversettelseskvalitet, etterslep, gjenkjenningsnøyaktighet og talesyntese. Qwen publiserer ikke rivalenes poeng i bloggen. Ta det som retning, ikke innkjøpsfasit.

Kontekstvinduet er 53 248 tokens: maks 49 152 inn, 4 096 ut. Det er møte og samtale, ikke timeslang filmanalyse. Bildeinn er støttet, så visuell kontekst kan løse tvetydige termer. Norsk, svensk og dansk er med både som innlyd/uttekst og som talt utdata.

Pris, kvote og geografi

Singapore, internasjonalt: 7,50 dollar per million tokens lyd inn, 0,55 for bilde inn, 20 for tekst ut, 30 for lyd ut. Beijing er billigere: 5,653 / 0,466 / 14,133 / 22,613. Lyd telles som 7 tokens per sekund inn og 12,5 tokens per sekund ut.

En time innlyd blir da omtrent 25 200 tokens, rundt 0,19 dollar i Singapore. En time talt oversettelse blir omtrent 45 000 tokens, rundt 1,35 dollar. Tekstutskrift av kildespråket kommer på toppen hvis dere slår på transkripsjon. Menneskelig konferansetolk koster et annet størrelsesorden. Flaskehalsen er ikke prisen per time. Den er kvoten: 10 kall og 100 000 tokens i minuttet, i både Singapore og Beijing. Mange parallelle møter treffer veggen før budsjettet gjør det.

Frankfurt står i Omni-dokumentasjonen. LiveTranslate-siden lister Singapore og Beijing. Internasjonal produksjon går da mot Singapore, ikke et EØS-endepunkt. Databehandler er Alibaba. Ingen vektfil. Ingen lokal runtime.

Hva det betyr for ledergruppen

Tre beslutninger.

Først: arbeidsflate. En modell som skiller talere, speiler originalstemmen og holder fagspråk over lange turer, er ikke undertekst. Den er en ny databehandler mot styre-, kunde- og forhandlingslyd. Skru av produksjon på rå samtaler til DPA, retention og menneskelig stans er på plass.

Deretter: leverandør. Qwen har allerede Omni-Flash for møtevideo og agenter. LiveTranslate er den smale tolken. Dere kjøper ikke «beste omni». Dere kjøper en billig, norsk-kapabel sanntidstolk med internasjonalt endepunkt i Singapore. Google Gemini Live og OpenAI Realtime er de åpenbare vestlige alternativene. Alibaba selv peker LiveTranslate som erstatning for Gemini Live på oversettelse.

Til slutt: evidens. LAAL 2,3 sekunder og 60 språk er labtall. Be om dataflyt, underleverandører, om møtelyd kan trene videre, og om norsk bokmål faktisk treffer i deres aksent og fagspråk. Si nei til styremøter og kundesamtaler til det ligger i kontrakten.

Kilder og medier

Primærkilde: Qwen, «Qwen3.8-LiveTranslate: Names the speaker. Carries the meaning.», 18. september 2026: https://qwen.ai/blog?id=qwen3.8-livetranslate

Bekreftet i Alibaba Cloud Model Studio-dokumentasjon for qwen3.8-livetranslate-flash-realtime, inkludert pris og kontekstgrenser.

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.