Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face • Bloomberg: NVIDIA-kunder varsles om over 15 prosent prishopp på AI-servere • OpenAI kutter GPT-5.6 Sol mer enn 20 prosent – i tre måneder

Gemini 3.5 Transcribe: 4 % WER live – 10 minutter, uten batch
AI-modellerGoogleGeminiSpeech-to-textStemmeagenterCIOCISO

Gemini 3.5 Transcribe: 4 % WER live – 10 minutter, uten batch

JH
Joachim Høgby
26. august 202626. august 20266 min lesingKilde: Google

Google lanserte 26. august 2026 Gemini 3.5 Transcribe, selskapets nye tale-til-tekst-modell. Den avløser Chirp 3. Dette er ikke Gemini 3.5 Pro. Det er en tale-modell i public preview, med egne API-ID-er, egne tak og egen pris.

For CIO og CISO er tre fakta mer verdifulle enn Googles «most precise yet». Live-strømmen er 10 minutter per økt. Diarisering og ordtidsstempler finnes bare på fil, ikke i Live API. Gratisnivået brukes til å forbedre Googles produkter. Betalt nivå gjør det ikke.

Hva som faktisk er lansert

To endepunkter.

gemini-3.5-transcribe-live går over Live API med toveis strømming og subsekund latens. gemini-3.5-transcribe går over Interactions API for opptak, møter og samtalelogger. Google peker på stemmeagenter, sanntidsteksting og analyse etter samtalen.

Smart transkripsjon rydder selvrettinger, fjerner fyllord og formatterer tekst. Egendefinert vokabular tar inntil 1000 termer. Google sier beste treff ligger rundt 100. Modellen detekterer over 85 språk automatisk, inkludert norsk (nb-NO), og tåler språkbytte midt i setningen. Alfanumeriske strenger som postnummer og ordrenummer trekkes fram som et styrkepunkt.

Diarisering er dokumentert for inntil åtte talere på fil. Google-bloggen lover nøyaktig attribusjon for inntil tre. Støtte for tre eller flere merkes som eksperimentell. Live-strømmen har verken diarisering eller ordtidsstempler. Modellkortet advarer dessuten at tidsstempler på fil senker transkripsjonsnøyaktigheten.

Funksjonskall, der transkripsjonen kan delegere til andre Gemini-modeller, vises i Gemini-appen på macOS. Modellkortet for API-et sier at function calling, caching, batch, flex og priority inference ikke er støttet. Det skillet er innkjøpsrelevant: det du ser i desktop-appen, er ikke det du får i produksjons-API-et.

Tallene Google og Artificial Analysis oppgir

Artificial Analysis måler 4,0 prosent WER i strømming og 2,6 prosent på ferdig audio. Tid til ferdig transkript er 70 prosent kortere enn Chirp 3. På FLEURS, på et sett av topp-språk, er WER 5,50 prosent live og 5,04 prosent uten strømming.

Filgrensen er én time. Med diarisering eller tidsstempler synker den til 30 minutter. Live-økten er 10 minutter. Det er for kort for et styremøte, og det er for kort for en kundesenterøkt uten at du selv kutter og limer.

Prisen står på Gemini Developer API-siden. Unary transcribe: 2 dollar per million input-tokener eller 0,003 dollar per minutt lyd, 12 dollar per million output eller 0,002 dollar per minutt tekst. Google anslår blandet rate på om lag 0,005 dollar per minutt, rundt 0,30 dollar per time. Live: 3,50 dollar per million input eller 0,005 dollar per minutt, 21 dollar per million output eller 0,004 dollar per minutt tekst. Blandet anslag er om lag 0,009 dollar per minutt.

Det er billig mot klassisk sky-STT. Det er ikke GA. Batch-API finnes ikke. Priority inference finnes ikke.

Hvor den kjører, og hvor den ikke gjør det

Utviklere får public preview i Gemini API via Google AI Studio og Google Antigravity. I Antigravity kan modellen, med tillatelse, bruke skjermkontekst og chat-historikk for å treffe filnavn, agenttekst og åpne dokumenter. Det er nyttig. Det er også et nytt dataflate: stemmen treffer det som står på skjermen.

Enterprise får public preview på Gemini Enterprise Agent Platform. Gemini Enterprise for Customer Experience kommer senere. Det er ikke en ferdig kundesenterpakke i dag.

For alle: Gemini-appen på macOS, på engelsk. Rambler i Gboard på Android i utvalgte land og språk. Chrome kommer, med diktering i vilkårlige webfelt.

The Verge fikk på forhånd beskjed om også Gemini 3.5 Live og 3.5 Live Experimental. Google korrigerte: bare 3.5 Transcribe kunngjøres i dag. Ikke bygg innkjøp på den tilbaketrukne trioen.

Hva dette betyr for lederbordet

Stemmeagenter, møtereferat og kundesenter kan nå kjøpe Google-STT med lavere WER og 85 språk uten å stå i Chirp-køen. Kontrakten er preview. Live-taket på 10 minutter er en arkitekturbegrensning, ikke en lisensdetalj. Diarisering som compliance-spor finnes bare på fil. Gratisnivået er en treningsavtale. Betalt nivå er den eneste stien der Google sier at dataene ikke brukes til å forbedre produktene.

Hvis transkripsjonen skal inn i saksbehandling, KYC eller helse, er det CISO som eier neste spørsmål: databehandleravtale, region, lagring, og om skjermkontekst i Antigravity er slått på. Norsk språk er på listen. Norsk personvern er ikke.

Kilder og medier

Primærkilde: Google, Introducing Gemini 3.5 Transcribe, https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3.5-transcribe/

Modellkort: Gemini API, Gemini 3.5 Transcribe, https://ai.google.dev/gemini-api/docs/models/gemini-3.5-transcribe

Pris: Gemini Developer API pricing, https://ai.google.dev/gemini-api/docs/pricing

The Verge: Google’s new AI transcription edits out your ‘ums’ and ‘ahs’, https://www.theverge.com/tech/985186/google-gemini-3-5-transcribe-audio-ai

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.