Gemini 3.8 Flash TTS: 0,50/9 dollar – kloning, ikke Enterprise
Google slipper 23. september 2026 Gemini 3.8 Flash TTS og Gemini 3.8 Flash-Lite TTS. Modell-ID på Gemini API er gemini-3.8-flash-tts og gemini-3.8-flash-lite-tts. Listepris til 31. desember 2026: 0,50 dollar per million inn-tokens (tekst) for begge. Ut: 9 dollar per million lydtokens for Flash, 6 dollar for Flash-Lite. Fra 1. januar 2027 dobles det til 1/18 og 1/12. 25 lydtokens per sekund. Flash dekker 130 språk, inkludert bokmål og nynorsk. Flash-Lite dekker 101. 8192 inn, 16384 ut. Tilgjengelig samme dag i Gemini API og Google AI Studio. Gemini Notebook får Flash TTS. Google Vids får Flash-Lite. Gemini Enterprise API kommer. For CIO er dette et kutt mot 3.1-preview på 1/20 dollar, med brudd i API-skjema. For CISO er det stemmekloning fra 10–30 sekunder, samtykkelogg, SynthID og C2PA – og at gratisnivået brukes til å forbedre produktene.
Hva Google faktisk lanserer
Bloggen kaller modellene «most expressive audio generation models yet». Det som er konkret: Flash TTS er den kreative flaggskip-varianten for studio, lydbok, podcast og flersnakker-dialog. Flash-Lite er volum- og latenstier for dubbing, opplesing og taleagenter. Begge deler samme API-skjema. Flash erstatter ikke 3.1-preview én-til-én; Google peker Flash-Lite som anbefalt erstatning for gemini-3.1-flash-tts-preview.
Dette er TTS, ikke Live API. Live er ustrukturert samtale. TTS er ordrett opplesing med speech_metadata for stil og taler. 2000+ ferdige stemmer, pluss voice design fra naturlig språk og voice replication. Voice remixing (timbre, pitch, tempo, aksent på en eksisterende stemme) kommer senere. Hume AI Voice Design: 71,4, først. Aksentmodellering 60,8, først. Overall Quality: Flash først, Flash-Lite nummer to. Det er Googles egne henvisninger til Hume og Voice Arena, ikke en uavhengig hogby-måling.
Pris og FinOps
Betalt standard, per million tokens, til 31. desember 2026: Flash 0,50 inn / 9 ut. Flash-Lite 0,50 inn / 6 ut. Fra 1. januar 2027: 1/18 og 1/12. Batch og Flex til halv pris. Priority 1,8 ganger: Flash 0,90/16,20 i kampanjeperioden. Caching: 0,125 dollar per million inn til årsskiftet, 0,50 dollar per million per time for lagring. Gratisnivået er uten tokenpris, men innholdet brukes til å forbedre produktene. Betalt nivå: nei.
3.1 Flash TTS Preview står fortsatt på 1/20 dollar uten kampanjevindu. 3.8 Flash halverer inn og kutter ut fra 20 til 9 i kampanjeperioden. 25 lydtokens per sekund gir om lag 11,1 timer lyd per million ut-tokens. Til 9 dollar er det om lag 1,35 cent per minutt på Flash, 0,90 cent på Flash-Lite, før 2027-doblingen. Inn-taket på 8192 tokens tvinger oppdeling av lange manus. Budsjetter 2027-prisen, ikke kampanjen.
Stemmekloning og CISO
Voice replication tar to opptak fra samme voksne taler: 10–30 sekunder referanse, pluss et samtykkeopptak der taleren sier at hen eier stemmen og samtykker til at Google lager en syntetisk stemmemodell. Anbefalt format: 24 kHz mono 16-bit WAV. Standard er lagret profil i prosjektet (store=true): voice_…, inntil 200 stemmer per prosjekt delt med designede stemmer, ett års TTL. Alternativet store=false gir en kryptert voicekey_… dere lagrer selv, med sju dagers levetid.
Alle Gemini Audio-klipp merkes med SynthID. Google viser også til C2PA-credentials. SynthID gjør generert tale detekterbar; det stopper ikke misbruk. Samtykkesjekken er en teknisk kontroll, ikke en juridisk garanti mot deepfake mot ansatte, kunder eller merkevare. Gratisnivået trener på innhold. Biometriske stemmeprofiler i Googles prosjekt er et databehandlingsvalg. Krever dere null serverlagring av stemme, bruk stateless nøkkel og slett den.
API-brudd mot 3.1
Tekst er ordrett transkript. «Si glad: Hei» kan bli lest høyt. Stil og talernavn skal i speech_metadata. Vokale øyeblikksmerker som og blir i teksten. Hver tur i flersnakker-kall må ha speaker. Unary kall returnerer WAV med RIFF-header, ikke rå PCM som 3.1-preview. Pipelines som pakker PCM i WAV selv, vil doble header. Caching, batch, flex og priority er støttet. Live API, function calling, tenking og grounding er det ikke.
Hva ledelsen bør gjøre nå
Sett Flash-Lite som standard for agenter og volum, Flash for produksjon der aksent og skuespill teller. Ikke vent på Gemini Enterprise API hvis kravet er DPA, provisioned throughput og at data ikke trener produktet: det er betalt Gemini API i dag, Enterprise «kommer». Kartlegg stemmekloning som identitetsrisiko. Forby kloning av ansatte uten skriftlig og innlest samtykke. Test 3.1-migrering mot WAV-default og speech_metadata før kutt. Pris inn doblingen 1. januar 2027 i FinOps, ikke kampanjetallene.
Kilder og medier
Primærkilde: Google, https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/
Pris, modell-ID, språk og migrering: Gemini API-dokumentasjonen for gemini-3.8-flash-tts, speech generation, voice replication og Developer API pricing. Model card: Gemini 3.8 Audio hos Google DeepMind.
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.