Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Anthropic: Claude-bruddene var alignment-feil, ikke bare sandbox • Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face • Bloomberg: NVIDIA-kunder varsles om over 15 prosent prishopp på AI-servere

Meta Muse Voice Transcribe: 3,1 % WER live – vektene forblir stengt
AI-modellerMetaMuseTaleASRCIOCISOPersonvern

Meta Muse Voice Transcribe: 3,1 % WER live – vektene forblir stengt

JH
Joachim Høgby
1. september 20261. september 20266 min lesingKilde: Meta

Meta Superintelligence Labs lanserte 1. september Muse Voice Transcribe, labens første sanntidsmodell for lyd. Det er ikke en ny Llama og ikke en ny kodeagent. Det er ører til agentene: strømmende tale-til-tekst, taleridentitet for mer enn 20 personer, og deteksjon av når noen er ferdig med å snakke, i én modell.

For CIO og CISO er tre ting avgjørende. Modellen er stengt. Den koster 0,18 dollar per time behandlet lyd. Og den er allerede i produksjon: diktering i Meta AI for Mac, stemmeinput i Muse Code, og Meta Model API som muse-voice-transcribe-1.0.

Hva Meta faktisk slipper

Muse Voice Transcribe er en autoregressiv multimodal modell i Muse Spark-familien. Lyden leses i biter på 80 millisekunder, 12,5 ganger i sekundet. For hver bit velger modellen om den skal fortsette å lytte eller skrive ut tekst. Når den venter, predikerer den et eget token og bytter det ut med neste lydbit. Når strømmen stopper, tømmes resten av teksten.

Forsinkelsen er ikke fast. Meta kaller det adaptive delay. Forsterkningslæring kombinerer belønning for lav ordfeilrate og belønning for lav ventetid, multiplikativt. Enkle ord committer den raskt. Vanskelige ord får mer kontekst. Meta hevder at dette gir paretofronten for tid til ferdig transkripsjon.

Diarisering og endepunkting er ikke egne rør. De er spesialtoken oppå samme ASR. Modellen merker talerskifte så snart det skjer, og setter talermerke A til Z på slutten av biten. Tale start og slutt merkes med egne onset- og endpoint-token. Begge oppgavene trenes sammen med ASR, med ekstra belønning.

Modellen er trent på mer enn 70 språk. 25 er grundig verifisert ved lansering. Den takler kodeveksling inne i setningen, og den kan styres med språk-, nøkkelord- og kontekstbias. Lange opptak over én time med mer enn 20 talere krever ifølge Meta ingen etterbehandling.

Det den ikke gjør, står i utviklerdokumentasjonen. Ingen talesyntese. Ingen speech-to-speech. Ingen ordnivå-tidsstempler, bare tur-nivå. Ingen lydeventer og ingen emosjonsdeteksjon. Det er ører, ikke munn.

Tallene, og hva de ikke er

Meta skriver at Muse Voice Transcribe leder Artificial Analysis for strømmende tale-til-tekst og offentlige diariseringsbenchmarks, med modellutvalg per 1. september 2026. Uavhengig dekning oppgir 3,1 prosent ordfeilrate på AA-WER Streaming, med ferdig transkripsjon 0,16 sekunder etter at talen stopper. Cartesia Ink-2 ligger på 3,4, ElevenLabs Scribe v2 Realtime på 3,6, GPT Live Transcribe på 3,9 og Gemini 3.5 Transcribe Live på 4,0. På diarisering oppgis 17,5 prosent gjennomsnittlig feilrate mot 21,1 til 28,6 for fem andre systemer.

Det er labens og pressens tall, ikke hogby.ai sin egen eval. Gemini 3.5 Transcribe kom for under en uke siden. Forskjellen er liten i WER, større i pakken: Meta legger taleridentitet og endepunkting inn i samme modell og priser etter minutter, ikke tokens.

Pris, data og det du ikke kan hoste selv

Meta Model API tar 0,18 dollar per time behandlet lyd, det samme som 3 dollar per 1 000 minutter. Strømming og filopplasting koster det samme. Zero data retention koster det samme som standard. Rabatten for treningsberettiget data finnes ikke for denne modellen ved lansering.

To endepunkter, samme modell: WebSocket for live-lyd og POST for fil. På Mac holder brukeren Fn for diktering i vilkårlig app. Live-endepunktet autentiseres i handshake, ikke i Authorization-header.

Vektene er stengt. Muse Glimmer, Metas 30B lokale agentmodell, er Apache 2.0. Muse Voice Transcribe er det ikke. Det finnes ingen self-host-sti. Lyd som skal transkriberes, går til Metas API med mindre du velger en annen leverandør.

For norske styrerom, helse og advokat er det kontraktsspørsmålet. ZDR fjerner treningsbruk og lagring utover det produktet trenger, men det fjerner ikke at audio forlater virksomheten. Taleridentitet på 20 personer i timevise møter er nyttig. Det er også en ny klasse personopplysninger: hvem sa hva, når, i hvilket rom.

Hva ledergruppen bør gjøre nå

Mål mot tre alternativer, ikke mot Metas pressemelding. Gemini 3.5 Transcribe sitter allerede i Google-stacken. Dedikerte STT-leverandører har egne ZDR-vilkår og ofte ordnivå-tidsstempler som Meta ikke gir. Muse Voice Transcribe vinner hvis du vil ha taler, endepunkt og flerspråk i ett kall, til timepris, og aksepterer stengt modell.

Ikke slå den på i styre- og kundesamtaler før databehandleravtale, lagringstid, underleverandører og slettelogikk er avklart. Test kodeveksling på norsk-engelsk selv. Meta har verifisert 25 språk. Norsk er ikke blant språkene Meta fremhever i lanseringsdemoene.

Dette er en persepsjonsmodell, ikke en frontiermodell for koding. Den endrer likevel agentarkitekturen: stemmeagenter, møteintelligens og briller trenger ører som ikke venter på batch. Meta har nå lagt dem i API-et. Vektene blir du ikke eier av.

Kilder og medier

Primærkilde: Meta, Introducing Muse Voice Transcribe: https://research.meta.ai/blog/introducing-muse-voice-transcribe Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.