Mercury Voice: 320 ms – 0,20/0,75 dollar, 128k, sales-gated
Inception Labs gjør Mercury Voice allment tilgjengelig for enterprise 29. september 2026. Det er en diffusjons-LLM trimmet for voice-agenter: den resonnerer, kaller verktøy og følger lange systemprompter. Laben måler median tid til første svar-token på under 320 millisekunder på kundeservice-prompter. Listen er 0,40 dollar per million inn-tokens og 1,50 dollar per million ut. Ved lansering 50 prosent av: 0,20 og 0,75. For CIO er det et OpenAI-kompatibelt drop-in i LiveKit, Pipecat, Vapi og Retell. For CISO er det et salgsstyrt endepunkt uten systemkort i produktnotatet, allerede brukt i drive-thru og innkrevingsanrop.
Hva Inception faktisk skipper
Mercury Voice ble forhåndsvist for to uker siden sammen med Mercury 2.5. Nå er den GA for enterprise-kunder. Kontekstvindu 128 000 tokens. Inntil 50 000 ut-tokens. Tre reasoning-nivåer: low, medium og high. Tilgang går via sales@inceptionlabs.ai. Det er ikke et åpent selvbetjent API.
Laben optimaliserer for time to first answer token, TTFAT: tiden fra ferdig resonnement til første token som faktisk leses opp. Målet er under 500 millisekunder. Lenger pause føles unaturlig i telefonen. Mercury Voice på low effort er ifølge Inception den eneste testede modellen med median under 500 millisekunder. p50 er 320 millisekunder. p95 er 750 millisekunder. GPT-6 Luna uten reasoning er 5,9 ganger tregere på samme mål.
p95 på 750 millisekunder er raskere enn medianen til alle testede modeller unntatt GPT-OSS-120B på low på Cerebras, skriver laben. En p95 på fire sekunder betyr at omtrent hvert tjuende tur feiler i samtalen. Hale-latens er derfor like viktig som medianen.
Tallene er labens egne
Inception sier Mercury Voice slår Gemma 4 31B, GPT-6 Luna, GLM-5.3-Flash og Qwen3.5-397B på en sammensatt pakke av agentiske og konversasjonelle tester: tau-3-bench Telecom, Retail og Airline, IFBench og BFCL v4. Gemini 3.5 Flash-Lite er også listet som slått. Når kvalitet og latens plottes sammen, hevder laben høyere kvalitet enn nesten alle testede modeller og dobbel fart mot den nest raskeste.
Det er ikke et uavhengig lederboard. hogby.ai har tidligere dekket Mercury 2.5 som subagent-fart, ikke frontier. Voice-varianten arver samme forbehold: produksjonsfart, egne benker, salgsport. Voice-byggere har måttet velge mellom en treg resonneringsmodell og en rask modell uten tenking. Standard har vært Gemma 4 31B uten reasoning og GPT-4.1. Mercury Voice er Inceptions svar på det gapet.
Arkitekturen er diffusjon, ikke neste-token. Det er poenget bak latens-tallene. Det er også grunnen til at sammenligning mot autoregressive flash-modeller må kjøres på deres egne samtaler, ikke bare på labens kundeservice-sett.
Pris, minuttkost og hvor det stopper
Standardpris 0,40/1,50. Lanseringsrabatt 0,20/0,75. Laben regner en typisk voice-agentprofil til om lag 0,009 dollar per samtaleminutt, rundt fem ganger billigere enn GPT-4.1 på 0,045 dollar per minutt. Profilen er deres. Tokenmix i kundeservice-settet er ikke offentlig brutt ned. Rabatten er lansering. Listen er det som gjenstår når kampanjen er over.
Ingen hosted chat for sluttbruker. Ingen oppgitt EØS-residens, DPA-mal eller retention i produktnotatet. Enterprise-kunder som vil inn, må gjennom salg. Drop-in mot OpenAI-kompatibelt endepunkt senker integrasjonskost, ikke leverandørrisiko.
Produksjon: drive-thru og innkreving
Audivi AI bruker Mercury Voice i automatisk drive-thru: bestillinger, endringer og oppsalg uten menneske i løkken. Altur kjører innkrevings- og innsigelsessamtaler for finans og kaller Mercury Voice den raskeste modellen de har testet. OpenCall, som hogby allerede har sett i Mercury 2.5-dekningen, oppgir median modellrespons nær 170 millisekunder på produksjonsvolum. Det tallet er knyttet til Mercury-familien, ikke isolert til Voice-GA.
CISO-spørsmålet er ikke 320 millisekunder. Det er verktøykall og lange systemprompter i live telefoni mot betalingsplaner og kundefront, hos en lab uten systemkort i denne lanseringen. Innkreving og drive-thru er produksjon, ikke demo. Logging av tale, verktøysvar og prompt-innhold må avklares før pilot.
Hva leder bør gjøre
Kjør latency og kvalitet på egne samtaler, ikke tau-3-bench. Avklar databehandling, lagring av tale og tool-logger før pilot i finans eller helse. Hold GPT-6 Luna og øvrige flash-modeller som kontrollgruppe. Ikke flytt produksjon på lanseringsrabatt alene. Be om residens, underleverandører og slettefrist skriftlig. 128k kontekst og 50k ut er taket. Det er ikke en Astra-erstatning.
Kilder og medier
Primærkilde: Inception, Introducing Mercury Voice, 29. september 2026. https://www.inceptionlabs.ai/blog/introducing-mercury-voice
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.