Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

OpenAI-agenter rammet RubyGems: over 2000 pakker – kalt godartet • Anthropic: Claude-bruddene var alignment-feil, ikke bare sandbox • Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face

Google slipper Gemini 3.8 Live: tale i API – Enterprise i preview
AI-modellerGoogleGeminiGemini 3.8 LiveStemmeagenterLive APICIOCISOFinOpsAI-agenter

Google slipper Gemini 3.8 Live: tale i API – Enterprise i preview

JH
Joachim Høgby
15. september 202615. september 20266 min lesingKilde: Google

Google har sluppet to nye native tale-til-tale-modeller 15. september 2026. Gemini 3.8 Live er workhorsen for lav latens. Gemini 3.8 Live Extended Thinking er den tunge varianten som resonnerer i bakgrunnen mens den snakker. Begge er i Gemini API og Google AI Studio samme dag. Gemini Enterprise er privat preview.

For CIO og CISO er dette ikke en stemme-demo. Det er et skifte i hvordan stemmeagenter bygges: fra kaskade med ASR, LLM og TTS til én nativ modell som hører, ser, kaller verktøy og svarer i samme strøm. Det endrer integrasjon, kostnad og styring.

Hva som faktisk er lansert

Modell-ID-ene er gemini-3.8-live og gemini-3.8-live-extended-thinking. De er merket stabile i Gemini API. Inn: tekst, bilde, lyd og video. Ut: tekst og lyd. API-dokumentasjonen setter input til 131 072 tokens og output til 65 536. Modellkortet runder til 128K inn og 64K ut. De er basert på Gemini 3 Pro, ifølge Google DeepMind.

3.8 Live er default for lav latens uten resonneringsforsinkelse. Den har interleaved reasoning, asynkrone funksjonskall, klientoppdateringer gjennom hele sesjonen og innebygd lydstrøm. thinking_level er ikke støttet. Proaktiv lyd er permanent på. Affective dialogue er fjernet.

3.8 Live Extended Thinking er for flertrinns oppgaver. Den planlegger og kaller asynkrone verktøy i bakgrunnen mens den snakker fyllord og fremdriftsnarrativ. thinking_level kan settes til low, medium eller high. minimal er ikke støttet. Verktøy må deklareres som NON_BLOCKING.

Google ruller 3.8 Live ut i Search Live for alle, og i API og AI Studio for utviklere. 3.8 Live Extended Thinking kommer i Gemini Live, i Docs for Google AI Pro og Ultra, og i Gmail og Keep for alle Google AI-abonnenter. For bedrift: privat preview i Gemini Enterprise. Gemini Enterprise for Customer Experience kommer senere. Workspace-bedriftskunder får Extended Thinking «coming soon».

Det som ikke følger med: caching, kodekjøring, fil-søk, strukturert utdata, URL-kontekst, Batch API, kart-grounding og bildegenerering. Søke-grounding og funksjonskall er støttet.

Protokollen er en integrasjonsrisiko

Native tale-til-tale er Googles poeng mot kaskade-arkitektur. Modellen skal holde samtalen i gang mens den kaller API-er. 3.8 Live kan fortsatt bruke synkrone BLOCKING-verktøy. Extended Thinking krever asynkront.

Det viktigste for utviklere: turnComplete: true betyr ikke lenger at sesjonen er idle på Extended Thinking. Serveren kan fortsette bakgrunnsresonnering og verktøykall. Klienten må lytte videre. Livssyklus styres av interaction_status: IN_PROGRESS under bakgrunnsarbeid, IDLE når oppgaven er ferdig. Hvis agentplattformen deres lukker turen på turnComplete, vil Extended Thinking se ut som den henger eller kutter av midt i jobben.

Migrering fra gemini-3.1-flash-live-preview er mer enn modellstreng. Videoframes sendes som default (TURN_INCLUDES_AUDIO_ACTIVITY_AND_ALL_VIDEO). Google advarer om å bare sende rammer når dere trenger dem, ellers spiser kontekst og kostnad. Lyd inn er 16 kHz PCM. Lyd ut er 24 kHz PCM. Audio er støttet responsmodalitet. Tekst krever output-transkripsjon.

97 språk med automatisk bytte midt i samtalen. Visuell kontekst i nær sanntid. Google viser onboarding, sjakk med kamera, skisser til React-komponenter, og flertrinns booking uten å bryte taleflyten.

Partnere som Agora, LiveKit, Pipecat, LangChain, Vercel, Fishjam og Vision Agents tar mediastreaming. Salesforce, Genspark og Lumeris er navngitt som tidlige bedriftspartnere. Det er leverandørutsagn, ikke produksjonsbevis.

Prisen er per minutt, inntil den ikke er det

Utviklerbloggen oppgir 0,005 dollar per minutt lyd inn og 0,018 dollar per minutt lyd ut. Fotnoten sier estimatet bygger på 3 dollar per million input-tokens og 12 dollar per million output-tokens. Det er ikke Flash-prisen. Stemme er dyrere per token, og sesjoner akkumulerer kontekst.

For FinOps: en stemmeagent som hører og snakker i ti minutter, med visuell kontekst og bakgrunnsverktøy, er ikke «billig multimodal chat». Caching er ikke støttet. Lange samtaler med videoframes default på, pluss tenketokens på Extended Thinking, driver regningen. Google hevder likevel konkurransedyktig pris mot andre frontier-stemmemodeller. Mål mot deres egne samtalelengder, ikke mot bloggens per-minutt-tall alene.

OpenAI slapp GPT-Live-1 i API 10. september til 5 cent per minutt. Googles 0,005/0,018 dollar per minutt inn/ut er et annet prisformat. Ikke sammenlign linje for linje uten å modellere verktøykall, visuell kontekst og tenking.

Tallene Google viser

Google sier 3.8 Live Extended Thinking tar førsteplass på Artificial Analysis Speech to Speech Quality Index med 82,6, leder agentisk oppgavefullføring med 68,6 prosent på τ-Voice og 35,1 prosent på Sierras τ-Voice-banking, og scorer 97,7 prosent på Big Bench Audio. 3.8 Live skal ligge på andreplass i Speech Agent Arena. På ServiceNows EVA-Bench, kjørt på Live API i Gemini Enterprise Agent Platform, hevder de å skyve Pareto-fronten for komplekse arbeidsflyter.

Vi tar det som leverandørkrav. EVA-Bench-noten forteller også at enterprise-tallet ikke er det samme som det du får i AI Studio i dag.

Sikkerhet og modellkort

Modellkortet for Gemini 3.8 Audio er datert 15. september 2026. Kunnskapsgrense: januar 2025. Kjente begrensninger: hallusinasjoner, arbeid med jailbreak-motstand, og tidvis treghet eller timeout. For en live kundeserviceagent er januar 2025 en hard grense mot produktendringer, avtalevilkår og CVE-er.

All AI-generert lyd fra Googles produkter er merket med SynthID, en umerkbar vannmerking vevd inn i lyden. Det er relevant for CISO og kommunikasjonsdirektør: opptak av stemmeagenter skal kunne skilles fra menneskestemme.

Frontier Safety: Google vurderte Gemini 3.7 Flash mot Frontier Safety Framework og fant ingen Tracked eller Critical Capability Levels. De skriver at 3.8 Live og Extended Thinking ikke har meningsfulle nye evner eller materielle løft mot 3.7 Flash, og derfor neppe treffer T/CCL. Det er en arvet konklusjon, ikke en ny, selvstendig grensevurdering av stemmemodellene.

Hva dette betyr for ledere

Sett 3.8 Live i test på de faktiske stemmeflytene: kundesenter, intern IT-support, onboarding og møteassistenter. Mål avbrudd, feil på saksnummer, språkbytte og verktøylatens, ikke bare «den høres naturlig ut».

Ikke rull Extended Thinking inn som default i produksjon uten eier for thinking_level og uten at klienten tåler den nye idle-protokollen. Private preview i Gemini Enterprise betyr at dette ikke er GA for styrte bedriftsagenter ennå. Search Live og Gemini-appen er forbrukersporet.

Kunnskapsgrensen januar 2025 krever grounding eller egne verktøy for alt som endret seg etter det. Søke-grounding er støttet. URL-kontekst er det ikke.

Pris inn i prognosen som sesjon, ikke som chat-tur. Videoframes og tenking kan viske ut det pene per-minutt-tallet. Behold 3.1 Flash Live som kontrollarm til dere har egne tall, eller aksepter at Google peker på 3.8 Live som etterfølger.

SynthID og opptakspolicy må avklares før stemmeagenten treffer kunder. Hvis samtalen spilles inn, skal vannmerket og menneske-i-loopen inn i behandlingsprotokollen, ikke i en senere compliance-runde.

Kilder og medier

Primærkilde: Google, «Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking», https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/

Google, «Build real-time voice applications with Gemini 3.8 Live and 3.5 Transcribe», https://blog.google/innovation-and-ai/technology/developers-tools/build-real-time-voice-applications-gemini-audio/

Google, Gemini 3.8 Live-modelsiden, https://ai.google.dev/gemini-api/docs/models/gemini-3.8-live

Google, Gemini 3.8 Live Extended Thinking, https://ai.google.dev/gemini-api/docs/models/gemini-3.8-live-extended-thinking

Google, Thinking in the Live API, https://ai.google.dev/gemini-api/docs/live-api/thinking

Google DeepMind, modellkort for Gemini 3.8 Audio, https://deepmind.google/models/model-cards/gemini-3-8-audio/

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.