AA: Stemmeagenten folk liker, fullfører ikke saken
En stemmeagent kan høres ut som den har booket timen. Verktøykallet viser at den ikke har det. Artificial Analysis har sluppet Speech Agent Arena, en blind preferansetest der betalte og screenede deltakere gjennomfører samme oppgave med to skjulte speech-to-speech-modeller. Første snapshot er et innkjøpstall, ikke et forskningskuriosa: modellen folk liker å snakke med, er ikke den som fullfører jobben.
Gemini 3.1 Flash Live Preview i minimal-modus leder preferanse med 1046 Elo. Task Success Rate er 74,6 prosent. High-varianten ligger på 1014 Elo og 71,8 prosent. Grok Voice Think Fast 2.0 High tar 94,7 prosent av de kvalifiserte agentoppgavene, men ligger på 908 Elo og niendeplass i preferanse. OpenAI GPT-Realtime-2.1 High treffer 91,5 prosent og 892 Elo. ElevenLabs Agents, en kaskade av Scribe v2 Realtime, GPT-4o Mini og Eleven v3, tar 90,5 prosent og 937 Elo. GPT-Realtime-1.5 er ankeret på 1000 Elo og lander på 85,1 prosent.
Det er samme mønster hogby.ai har sett i tekst: nøyaktighet og completeness peker ofte hver sin vei. Her er det samtalefølelse mot eksekvering. AA skriver at noen samtaler høres ut som om handlingen er gjort, også når det påkrevde sluttkallet mangler eller er feil. For en CIO som ruller ut booking, refusjon eller betalingsdialog er det en styringssak. Hyggelig tone er ikke ferdig transaksjon.
Arenaen har 35 scenarier. Femten er agentiske og krever verktøy. Tjue er rene samtaler uten kall. Offentlig eksempel er ny pasient som skal booke tannlegetime tirsdag 09:30, eller tidligste ledige formiddag. Modellen skal slå opp konto, sjekke ledighet og booke. De fleste øvrige prompts og skjemaer er private. Det begrenser overfitting. Det begrenser også etterprøving. Elo beregnes med Bradley-Terry, separat for alle, agentiske og ikke-agentiske runder. Omtrentlige 95-prosentsintervall bruker samme Hessian-metode som TTS Arena.
Task Success Rate er andel kvalifiserte samtaler der modellen gjør riktig sluttkall med riktige argumenter. Støttekall og end_call teller ikke som ferdig jobb. Først sjekker en modelldommer at deltakeren faktisk forsøkte oppgaven og ga modellen en sjanse. Avvik og uverifiserbare runder tas ut. Deretter sjekkes verktøysporet. En feilet første forsøk kan reddes av et korrekt kall etterpå. Manglende kall, feil argumenter eller et ekstra sluttkall som ikke skulle vært der, er tap.
Respons slår gjennom i preferanse. Time to First Audio for Gemini Minimal er 0,96 sekunder. Grok 2.0 High er raskere på 0,70. GPT-Realtime-2 High ligger på 1,14. Qwen Audio 3.0 Realtime Plus bruker 1,54 sekunder og faller til 699 Elo, selv om den leder speech reasoning på Big Bench Audio med 99,2 prosent. Deltakere peker også på mer naturlig stemme og færre artefakter hos de foretrukne modellene. Rask første lyd vinner øret. Den vinner ikke automatisk bookingen.
Prisen gjør gapet konkret. Gemini Minimal koster 1,50 dollar per time input-lyd. Grok 2.0 High koster 4,80. GPT-Realtime-2.1 High koster 10,75. Det er sju ganger fra preferanselederen til den dyreste høy-pålitelighetsvarianten. I AA Speech to Speech Index, som nå vekter speech reasoning, tau-Voice, Arena-preferanse og Task Success Rate likt med 25 prosent hver, leder Grok 2.0 High med 79,0 prosent. GPT-Realtime-2.1 High ligger på 73,9. Gemini High på 71,5. Gemini Minimal faller til 63,9 fordi resonnering og agentytelse trekker ned. Indeksen krever alle fire tall. Mange modeller blir stående utenfor.
Kaskade er ikke slått. ElevenLabs-pipen konkurrerer både på Elo og på sluttkall. Native audio har ikke vunnet som standardvalg. Nova 2.0 Sonic ligger på 917 Elo, men bare 57,1 prosent Task Success Rate. Qwen3.5 Omni Flash Realtime faller til 29,1 prosent. En modell kan være rask og billig og likevel mislykkes i tre av fire ekte bestillinger.
For innkjøp er skillet enkelt. Der et tapt verktøykall koster penger eller tillit, filtrer først på Task Success Rate. Bruk Elo som tiebreaker for opplevd kvalitet. Der merkevare og samtaleopplevelse er produktet, og handlingen kan bekreftes i et annet system, kan Gemini Minimal være rasjonelt. Ikke kjøp én rangering. Kjøp aksen som treffer risikoen i deres flyt.
Arenaen erstatter Conversational Dynamics i indeksen. Full Duplex Bench lever videre som egen måling av pauser, turtaking, avbrudd og backchannel. Automatiske tester med syntetiske kunder overvurderer hvordan en ekte person opplever samtalen. Menneskelig preferanse overvurderer om jobben ble gjort. Dere trenger begge tall før en stemmekanal går i produksjon mot kunder.
Kilder og medier
Artificial Analysis: https://artificialanalysis.ai/speech-to-speech/arena/overview
Metodikk og indeksering: https://artificialanalysis.ai/methodology/speech-to-speech-benchmarking
Leaderboard: https://artificialanalysis.ai/speech-to-speech/arena
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.