Eleven v4: 10 sekunders kloning – Turbo 100 ms, 90 språk
ElevenLabs lanserer Eleven v4 og lavlatens-varianten v4 Turbo 28. september. Instant Voice Clone tar 10 sekunder med lyd. Turbo har median inferens rundt 100 millisekunder og tid til første tale rundt 150 millisekunder. For CIO er dette voice-agenter som kan være både raske og uttrykksfulle. For CISO er det et identitetsproblem: en lederstemme er ikke lenger en lang opptaksjobb.
Hva som faktisk kommer
Selskapet, ved Mati Staniszewski og Piotr Dabkowski, beskriver v4 som en ny arkitektur for tekst-til-tale, ikke en finpuss av v3. To API-ID-er er dokumentert: eleven_v4 for kvalitet og eleven_v4_turbo for sanntid. Begge er tilgjengelige nå i ElevenAgents, ElevenCreative og ElevenAPI. Tegngrensen for v4 er 10 000, mot 5 000 i v3. Språkdekning går fra 70+ til 90+.
ElevenLabs hevder førsteplass på Artificial Analysis’ Provider Voice Arena i september 2026, og at om lag 75 prosent av lytterne foretrakk v4 i blinde tester mot Cartesia Sonic 3.6, Inworld TTS-2 og Googles Gemini 3.8 Flash-TTS-varianter. Det er leverandørens egne sammenligninger. Uavhengig av rangeringen er produktvalget konkret: én modell for produksjon, én for agent.
Turbo er målt med median tid fra forespørsel til hørbar tale på rundt 150 millisekunder i september 2026, mot Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash-Lite TTS og OpenAI GPT-4o mini TTS. Nettverkslatens er trukket fra. Inferens er oppgitt til rundt 100 millisekunder over WebSocket. Det er gapet kundesenteret kjenner: robotstemme som svarer fort, eller menneskelig stemme som kommer for sent.
Kloning på 10 sekunder
Instant Voice Clone skal gi høy likhet med 10 sekunder kilde. Professional Voice Clones (PVC) kommer inn i v4 for høyest troskap. ElevenLabs sier identiteten holder bedre over lange generasjoner, dialog, regenererte linjer og request stitching i Studio og Reader. En stemme tatt opp på ett språk skal snakke de øvrige 90+ med native aksent, uten å gli tilbake mot kildens aksent underveis.
TechCrunch skriver at den største kvalitetsøkningen er i japansk, brasiliansk portugisisk, mandarin og kantonesisk. Dokumentasjonen oppgir at v4 bruker innstillingene Stability og Similarity. Style- og Speed-glidebryterne fra tidligere modeller er borte, og SSML er ikke støttet. Inline-tagger som [laughs] og [said angrily in French accent] kan stables, og IPA-uttale er forbedret. Biblioteket har over 10 000 stemmer. Turbo kan starte lyd så snart språkmodellen bak begynner å svare, via toveis strømming.
Hva det betyr for CIO og CISO
Voice-agenter har vært et kompromiss: rask og monoton, eller uttrykksfull og treg. v4 Turbo er ElevenLabs’ svar på det. Selskapet sier mer enn 55 prosent av omsetningen kommer fra store virksomheter. Årsomsetningen er ifølge TechCrunch steget fra rundt 330 millioner dollar tidlig i 2026 til over 600 millioner. Det er leverandørskala, ikke et kvalitetsbevis.
For CIO er SKU-valget det praktiske. eleven_v4 til innhold, dubbing og merkevarestemme. eleven_v4_turbo til sanntids agenter. Én merkevarestemme kan i prinsippet brukes på 90+ språk. Bindingen sitter i ElevenAgents hvis dere vil ha modell og orkestrering som ett system, i stedet for å sy sammen TTS, LLM og telefoni fra tre leverandører.
For CISO er 10-sekunders kloning det som endrer risikobildet. En lederstemme, en kundeservicemedarbeider eller en kjent intern stemme kan kopieres fra et kort opptak. Det treffer godkjenning over telefon, helpdesk-svindel og intern «sjefen ba meg». Policy må dekke hvem som får klone, samtykke, logging og hvor klonene får brukes. Voice-agenter som høres menneskelige ut reiser også spørsmål om merking og innsyn overfor kunder.
Hva som ikke er bevist
Lanseringsposten har ikke en åpen prisliste per million tegn. Uavhengig red-team mot kloningsmisbruk er ikke lagt ved. Artificial Analysis-plasseringen er sitert av leverandøren. v4 er en talemodell, ikke en frontier-LLM. Eldre kloner kan kreve ny trening; det bør sjekkes i eget miljø før kutt-over. TechCrunch bekrefter lanseringen og de harde produktpåstandene om 10 sekunder, 90 språk og lavere latens for agenter.
Kilder og medier
Primærkilde: https://elevenlabs.io/blog/eleven-v4 (ElevenLabs, 28. september 2026).
Også: TechCrunch, «ElevenLabs’ new v4 speech model supports more expression control and 90 languages», 28. september 2026; ElevenLabs-dokumentasjon for eleven_v4 og eleven_v4_turbo.
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.