Qwen3.5 Omni løfter stemmeagenter, men tregheten biter
Artificial Analysis har oppdatert sin Speech to Speech-ledertabell, og Qwen3.5 Omni Plus Realtime fra Alibaba/Qwen peker seg ut som et av de sterkeste native tale-til-tale-systemene i markedet. Modellen ligger helt i front på tale-resonnering i Big Bench Audio, og rangeres blant de mest interessante alternativene for stemmeagenter som skal forstå, resonnere og svare direkte med lyd, ikke bare transkribere til tekst og lese opp et svar igjen.
Det høres teknisk ut. Lederpoenget er enkelt: stemmeagenter er i ferd med å gå fra demo til driftsvalg. Da holder det ikke å spørre om modellen har en behagelig stemme. Den må forstå avbrudd, tåle pauser, løse oppgaver med verktøy, håndtere aksenter, gi raske svar og gjøre alt dette til en pris som ikke eksploderer når samtalene blir lange. Artificial Analysis måler nettopp dette på tvers av tale-resonnering, samtaledynamikk, agentisk oppgaveutførelse, svartid og kost.
Qwen3.5 Omni Plus Realtime er interessant fordi den viser hvor raskt kinesiske modellmiljøer flytter konkurransen fra tekst og kode til multimodal interaksjon. Qwen beskriver selv Omni-serien som en nativ omnimodal modellfamilie for tekst, bilde, lyd og audiovisuelle input. I Alibaba Cloud Model Studio tilbys realtime-varianten via WebSocket og WebRTC, med modellvalg som qwen3.5-omni-plus-realtime. Det betyr at dette ikke bare er et forskningsarkiv. Det er en API-kapabilitet utviklere kan koble inn i faktiske stemmeprodukter.
Samtidig er dette ikke en ren seier over OpenAI, Google og xAI. Den viktige tradeoffen er latency. Artificial Analysis løfter frem Time to First Audio som et kritisk mål for opplevd respons. På deres ledertabell finnes modeller som svarer langt raskere enn Qwen3.5 Omni Plus Realtime. For kundeservice, intern servicedesk, helserådgivning, booking, support og krisehåndtering kan forskjellen mellom under ett sekund og flere sekunder være forskjellen mellom naturlig dialog og en maskin som føles treg, selv om den resonnerer bedre.
Det er her CIO- og CISO-vinkelen blir praktisk. Mange virksomheter kommer til å kjøpe stemmeagenter i 2026 som om dette er en chatbot med mikrofon. Det er feil innkjøpsmodell. Native tale-til-tale-modeller har en egen risikoprofil: de må styres på samtalekvalitet, oppgavefullføring, logging, tilgang til verktøy, personvern, aksentbias, regionale dataløp og kost per samtaletime. En modell som scorer høyt på resonnering kan fortsatt være feil valg hvis den er for treg, for dyr, eller kjører i en region som ikke passer virksomhetens compliance-krav.
Benchmarkmetodikken til Artificial Analysis er nyttig fordi den splitter problemet i målbare deler. Big Bench Audio tester om modellen kan svare på resonneringsoppgaver levert som lyd. Full Duplex Bench-delen ser på samtaledynamikk: pauser, turtaking, avbrudd og små bekreftelser som «ja» og «mm». Agentic Performance bygger på τ-Voice, der modellen skal løse realistiske kundeserviceoppgaver med verktøy og policyer. Det er langt nærmere ekte drift enn en polert produktvideo der modellen får perfekte spørsmål i stille rom.
For norske ledere betyr dette tre ting. Først: stemme blir et reelt grensesnitt for arbeidsflyt, ikke bare en tilgjengelighetsfunksjon. Når modeller kan resonnere direkte over lyd, kan interne støttefunksjoner, feltarbeid, lager, service og kundedialog få AI-hjelp uten skjerm. For det andre: latency må inn i kravspesifikasjonen fra dag én. Lavest pris per token hjelper lite hvis agenten ødelegger rytmen i samtalen. For det tredje: evals må kjøres på egne samtaler, egne språk, egne aksenter og egne prosesser. En global leaderboard er et filter, ikke en fasit.
Qwen-resultatet bør også leses geopolitisk og leverandørstrategisk. Alibaba Cloud er ikke nødvendigvis et opplagt standardvalg for alle europeiske virksomheter, men modellkvaliteten legger press på vestlige leverandører. Hvis Qwen kan levere sterk tale-resonnering og konkurransedyktig kost, må OpenAI, Google, xAI og andre svare med bedre kombinasjon av intelligens, fart, datakontroll og enterprise-vilkår. Det er bra for kjøpere, men bare hvis innkjøpsteamet faktisk sammenligner på mer enn merkevare.
Min vurdering: dette er ikke en sak der man skal bytte stemmeplattform over natten. Men den bør trigge en ny evalrunde for alle som planlegger voice-first produkter eller interne stemmeagenter de neste seks til tolv månedene. Test Qwen3.5 Omni Plus Realtime mot GPT Realtime, Gemini native audio og Grok Voice på egne oppgaver. Mål første lyd, avbruddshåndtering, korrekt verktøybruk, språk/aksent, feilretting og samlet samtalekost. Ikke la demoen vinne anbudet.
Det større signalet er at modellkappløpet nå flytter seg inn i samtalen. Tekstmodeller konkurrerer på resonnement, kode og pris. Stemmeagenter må konkurrere på alt det samme, pluss menneskelig timing. Qwen viser at intelligensen kommer raskt. Markedet venter fortsatt på den perfekte kombinasjonen av smart, billig, trygg og umiddelbar. Den som klarer den firkanten, får en langt større rolle i virksomhetens faktiske arbeidsflyt enn dagens chatbotter.
Kilder og medier
Primærkilde: Artificial Analysis – https://artificialanalysis.ai/speech-to-speech Metode: Artificial Analysis – https://artificialanalysis.ai/methodology/speech-to-speech-benchmarking Qwen/Alibaba API-dokumentasjon: https://www.alibabacloud.com/help/en/model-studio/realtime Qwen teknisk bakgrunn: https://qwen.ai/blog?id=qwen3.5-omni X-discovery: Artificial Analysis – https://x.com/ArtificialAnlys/status/2082179251407917475 Thumbnail: OpenAI Image 2 / hogby.ai📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.