MAI-Transcribe-2-Streaming: 2,5 % WER – 0,54 dollar, 0,13 s
Microsoft AI slipper 1. oktober MAI-Transcribe-2-Streaming, labens første strømmende tale-til-tekst-modell. Samme dag kommer to TTS-modeller: MAI-Voice-2.1 og MAI-Voice-2.1-Flash. Artificial Analysis setter transkripsjonen på førsteplass av 38 strømmemodeller: 2,5 prosent WER og 0,13 sekunder fra tale slutter til ferdig tekst. Intropris er 0,54 dollar per time lyd ut 2026. For CIO er dette kontaktcenter, møter og stemmeagenter i Microsoft-stacken. For CISO er det kloning på få sekunder, samtykkespor, og at EØS-region ikke er lovet i kunngjøringen.
Hva Microsoft faktisk lanserer
MAI-Transcribe-2-Streaming er ikke en ny Copilot-chat. Det er ASR som skal skrive mens folk snakker. Laben sier 60 språk og automatisk, kontinuerlig språkdeteksjon. Språklisten er ikke i saken. Ikke anta Bokmål. Første delhypoteser, «partials», kommer like over 100 millisekunder etter at lyden treffer modellen. Deretter revideres teksten, og et stabilt transkript committes med en gang. Poenget er at en stemmeagent kan starte verktøykall midt i setningen.
Tilgjengelighet ifølge Microsoft: Microsoft Foundry, MAI Playground, Vercel og Azure Voice Live. LiveKit kommer. Voice-modellene ligger også på OpenRouter. Demoen Chatter i MAI Playground viser de tre modellene i én loop. Ingen EU-geo, ingen databehandleravtale og ingen lagringstid er beskrevet. Ikke les Foundry som at dette er godkjent for norsk helse eller offentlig tale.
Batch-søsteren MAI-Transcribe-2 ligger allerede i feltet. xAI slapp Grok Voice Transcribe 2.0 18. september: 2,3 prosent WER i batch, 0,10 dollar per time, kun us-east-1. Microsofts nye modell er strøm, ikke batch. Bland ikke de to tavlene.
Tallene som skal bære påstanden
Artificial Analysis, 1. oktober: MAI-Transcribe-2-Streaming tar førsteplass på AA-WER Streaming for både ferdig transkript og første partial.
Ferdig transkript: 2,5 prosent WER på 0,13 sekunder etter tale slutt, av 38 modeller. Grok Voice Transcribe 2.0 (Streaming) 2,7 prosent og 0,49 sekunder. Muse Voice Transcribe 3,1 prosent og 0,16 sekunder. ElevenLabs Scribe v2 Realtime 3,6 prosent og 0,14 sekunder. Cartesia Ink Preview (external) er raskere men dårligere: 3,1 prosent og 0,11 sekunder.
Første partial: 2,5 prosent WER på 0,12 sekunder. Grok 3,4 prosent og 0,49 sekunder. Cartesia Ink-2 (external) er raskere på 0,07 sekunder, men 4,0 prosent WER.
Microsofts egne tall: interne tester på diktering og undertekst viser at ord dukker opp dobbelt så fort som nærmeste konkurrent. Det er labens måling, ikke AA.
Pris: 0,54 dollar per time strøm ut året, 9 dollar per 1 000 minutter. AA plasserer det i øvre sjikt blant lederne, likt Gemini 3.5 Transcribe Live, over ElevenLabs Scribe v2 Realtime og Deepgram Flux på 6,50 dollar, mer enn dobbelt Cartesia Ink-2 på 4 dollar, og tre ganger Muse Voice Transcribe på 3 dollar. Non-stream MAI-Transcribe-2 er 0,10 dollar per time. Grok-strøm hos xAI er 0,20 dollar per time. Microsoft selger nøyaktighet og latens, ikke bunnspris.
MAI-Voice-2.1 og Flash
MAI-Voice-2.1 er labens sterkeste flerspråklige TTS: 23 språk, 26 lokaler. Én stemme skal holde identitet på tvers av språk, med lokal aksent, ikke én aksent dratt over alt. Pris 22 dollar per million tegn.
Flash har samme språk og krysspråklige stemmer, men er bygget for volum. Microsoft sier inntil 45 sekunder lyd, 150 millisekunder ende-til-ende-latens, 55 prosent raskere inferens og om lag 60 prosent billigere enn sammenlignbare modeller. Liste: 15 dollar per million tegn.
Begge støtter kloning på tvers av språkene med noen sekunders referanselyd. Microsoft skriver at samtykkerekkverk skal hindre misbruk. Det er en produktpåstand. Be om hvordan samtykke lagres, hvor referanseklippet ligger, og om klonen kan eksporteres ut av tenant.
Hva dette betyr for leder og CISO
Stemmeagent er en loop: høre, forstå, beslutte, snakke. Microsoft selger tid i begge ender. Transkripsjon 0,13 sekunder etter tale slutt, pluss Flash på 150 millisekunder, gir agenten rom til verktøy før samtalen kjennes treg.
Det er Microsoft-stack. Foundry og Azure Voice Live betyr at innkjøp kan ligge i eksisterende Azure-avtale. Det er også leverandørkonsentrasjon. Hvis Copilot, identitet og nå stemmen sitter hos samme part, blir exit dyrere.
CISO: tale er personopplysning. Kloning på få sekunder er merkevare og deepfake-risiko i samme produkt. Samtykkerekkverk i modellen er ikke det samme som intern policy, logging og DLP. Sjekk om opptak kan trene videre. Sjekk region. Kunngjøringen lover ikke EØS-ende.
FinOps: 0,54 dollar per time ser billig ut mot mennesker. Tusen timer i måneden er 540 dollar på intropris. Etter 31. desember 2026 er introprisen borte, og Microsoft har ikke publisert neste liste i saken. Pin prisen i kontrakt.
Ikke bytt ut Grok, ElevenLabs eller Deepgram på én blogpost. Kjør AA-WER mot egne opptak: norsk aksent, fagspråk, 8 kHz telefoni. 2,5 prosent på AA-AgentTalk, VoxPopuli og Earnings22 er engelsk-tungt. Norsk kontaktcenter er en annen test.
Kilder og medier
Primærkilde: Microsoft AI, «Our first streaming transcription model debuts at no. 1 on Artificial Analysis», 1. oktober 2026: https://microsoft.ai/news/our-first-streaming-transcription-model/
Uavhengig eval: Artificial Analysis, Speech to Text streaming, MAI-Transcribe-2-Streaming 2,5 prosent WER / 0,13 s: https://artificialanalysis.ai/speech-to-text/streaming
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.