Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Anthropic: Claude-bruddene var alignment-feil, ikke bare sandbox • Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face • Bloomberg: NVIDIA-kunder varsles om over 15 prosent prishopp på AI-servere

Inception slipper Mercury 2.5: 1107 tok/s, ikke frontier
InceptionMercury 2.5dLLMAI-modellerCIOCISOKodeInferens

Inception slipper Mercury 2.5: 1107 tok/s, ikke frontier

JH
Joachim Høgby
8. september 20268. september 20265 min lesingKilde: Inception

Inception Labs, ledet av Stefano Ermon, slapp 8. september Mercury 2.5 som produksjonsmodell. Det er ikke et nytt frontier-flaggskip. Det er en diffusjons-LLM, dLLM, som genererer mange tokens per steg i stedet for ett og ett. Selskapet lover samme lave latens som Mercury 2, og et kvalitetssteg de selv har målt.

Inception hevder 40 prosent høyere intelligence enn Mercury 2, og sammenligner med kostnadskuttede modeller: GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite og Claude Haiku 4.5. Farten er 1 107 tokens per sekund på vanlige NVIDIA-GPU-er. Konteksten er 260K, opp fra 128K. Listepris er 0,20 dollar per million input og 0,75 dollar per million output. Ved lansering er det 80 prosent avslag: 0,04 og 0,15. API-dokumentasjonen viser cache-input 0,02 dollar, 0,004 i kampanjen. Maks utdata er 65 536 tokens. Modell-ID er mercury-2.5.

For norske ledere er skillet mer verdifullt enn headline. Dette er et verktøy for mange, billige kall i en løkke. Det er ikke en modell som tar igjen Claude Fable 5.1 eller GPT-6 Astra på Artificial Analysis.

Hva Inception faktisk lover

dLLM-arkitekturen er poenget. Autoregressive modeller binder kostnad og ventetid til resonneringsdybde: jo mer den tenker, jo tregere og dyrere. Inception genererer tokens i parallell på NVIDIA-GPU, uten å kreve spesialsilisium. NVIDIA, ved Shruti Koparkar i Accelerated Computing Group, sier at 2.5 viser hvordan nye arkitekturer kan bli produksjonsklare på NVIDIA-plattformen. Det er leverandørkommentar, ikke en SLA.

Nye evner i 2.5: justerbar reasoning, parallelle verktøykall og skjema-bundet JSON. Ved siden av kommer forhåndsvisning av Mercury Voice, med tid til første token under 170 millisekunder, og Mercury Router, som ruter kall til åpne og lukkede modeller etter kvalitet, fart og pris. Begge er preview. Ikke budsjetter dem som kapasitet dere har i dag.

Tilgjengelighet: Inception API, Baseten og OpenRouter. En preview av 2.5 lå på OpenRouter fra 31. august. Dagens slipp er produksjons-ID og første-parts API. Enterprise: dedikert kapasitet, autoscaling, compliance-kontroller og konfigurerbar datalagring. API-et tilbys med 100 millioner gratistokens. Y Combinator-selskaper tilbys 500 000 dollar i deployment-fordeler. Det er kanal, ikke sikkerhetsgodkjenning.

Tallene som ikke er uavhengige

OpenCall, som bygger telefonagenter, sier Mercury ga median modell-latens nær 170 millisekunder. P99 gikk fra flere minutter til ett sekund. P50 gikk fra 0,4 til under 0,2 sekunder. Sitatet er knyttet til Mercury i produksjon, ikke eksplisitt bare 2.5. Augment Code brukte Mercury til kontekstkomprimering, modellruting og MCP-verktøysøk. Kompaktering: 82 prosent lavere latens, fra om lag 150 til 27 sekunder, og 90 prosent lavere kostnad. Verktøysammendrag under ett sekund. Kundecase, ikke felles eval.

Artificial Analysis har ikke rangert produksjons-Mercury 2.5 i Intelligence Index v4.3. Tredjeparts preview-kort har stått uten uavhengige rader. Behandle 40 prosent-tallet som Inceptions eget. Luna-, Haiku- og Flash-Lite-sammenligningen er deres. Hvis dere kjøper mot frontier-planlegging, er dette feil modellklasse.

Hva det betyr for CIO og CISO

Sett Mercury 2.5 inn der kallene gjentas inne i én brukerhandling: søkeagenter og RAG med plan, omskriving, rerank, oppsummering og sjekk. Stemmekanaler der pausen er produktet. Kodeagenter der kompaktering, ruting og verktøysøk spiser tid og tokens. Ikke bytt planleggingsmodellen. Fable 5.1 og Astra eier de tunge stegene. Mercury eier de mange, billige.

CISO: lukkede vekter. Databehandling hos Inception, Baseten eller OpenRouter. Konfigurerbar retention er et avtalekrav, ikke en default. Innlegget har ingen system card, ingen cyber-variant og ingen uavhengig red-team. Kampanjeprisen utløper. Listepris 0,20/0,75 er det dere skal modellere. 1 107 tok/s er oppgitt på widely-available NVIDIA GPUs, uten batchstørrelse, resonneringsnivå eller P99. Mål det på deres last.

Ikke putt persondata i chat.inceptionlabs.ai for en demo. Test med syntetiske saker. Mål tid til første token og kostnad per oppgave mot Luna, Haiku og Flash-Lite på samme harness. Hvis 2.5 taper kvalitet på verktøykall eller JSON-skjema, er farten irrelevant.

Inception trener allerede neste modell og sikter mot slipp om noen måneder. Det er veikart. Dagens beslutning er om dere har en latens-sløyfe som tåler en dLLM i midten, med egne evals, ikke Inceptions.

Kilder og medier

Primærkilde: Inception, «Introducing Mercury 2.5», 8. september 2026: https://www.inceptionlabs.ai/blog/introducing-mercury-2-5

Inception API-dokumentasjon, modell mercury-2.5: https://docs.inceptionlabs.ai/get-started/models

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.