TypeSafe slipper Jev: 70 ms-dommer – 0 % hallusinasjon er schema
TypeSafe AI har 15. september 2026 sluppet Jev, den første System One-modellen. Det er ikke en ny chatbot. Jev tar en tilstand og et sett typed spørsmål, og returnerer valg, skårer og sannsynligheter koden kan forgrene på direkte. Early access. Stengte vekter. Tjenesten kjører i USA.
For CIO og CISO er dette en modellklasse for agent-infrastruktur: ruting, skåring, verifikasjon og jailbreak-sjekk uten å parse fritekst. TypeSafe hevder 70–500 millisekunder og 0,042 dollar per million input-tokens. Output er gratis. Påstanden om null hallusinasjon gjelder schema, ikke at svaret er sant.
Hva som faktisk er lansert
Gründer Diogo Almeida, tidligere OpenAI-forsker og medforfatter av InstructGPT og RLHF, skriver at TypeSafe har brukt to år i stealth på en ny arkitektur, en parallell sampler og treningsmetoden Reinforcement Learning for Calibrated Decisions (RLCD). Medgründere er Erik Gafni og Sasha Sheng. Selskapet kom ut med om lag 40 millioner dollar i såkorn ledet av DCVC.
Jev evaluerer tre primitiver mot samme tilstand i ett kall: Choice (velg blant alternativer), Score (skår mot rubrikk) og Noul (er påstanden sann, verdi 0–1). Alle spørsmål kjøres parallelt og isolert. Cardinality på Choice er opptil 255. API-et er POST /v1/systemone med modellfeltet jev-latest.
Det Jev ikke gjør: skrive svar, kode eller forklaringer. System One er Kahneman-analogien for raske, avgrensede vurderinger. Tung resonnering skal dekomponeres og settes sammen i koden deres, ikke i en lang kjede. Navnet Jev peker på Jevons paradoks: mer effektiv bruk av tokens skal øke, ikke redusere, forbruket.
Tallene TypeSafe viser
Sammenligningen mot LLM-er er TypeSafes egen. De hevder samme intelligensnivå på System One-oppgaver, 40–200 ganger raskere, og input-pris 0,042 dollar per million tokens mot 0,20–10 dollar for typisk LLM-input. Output-tokens er «for billige til å måle».
Workflow-evalene deres måler ikke klassifikasjon mot fasit. De antar en korrekt beregningsgraf og bruker gjennomsnittet av GPT-6 Astra og Fable 5.1 som referansesannsynligheter. På den aksen sier TypeSafe at Jev eier Pareto-fronten i nesten to størrelsesordener, og at hjemmesidens 193,6 ganger raskere og 444,6 ganger billigere ligger i den øvre enden av reelle gevinster. Evals er kjørt fra laptoper på USAs vestkyst, der tjenesten står. De innrømmer at de ikke kan bevise at prisen ikke er subsidiert.
Side-om-side-demoen mot GPT-5.6 Terra viser parallell sannsynlighetsutgang mot autoregressiv tekst. TypeSafe sier selv at kort, tett input maler Jev i et gunstig lys. The Register gjengir en demo der Jev svarer på 0,114 sekunder mot 8,566 sekunder for Terra, og at Jev koster 238 ganger mindre enn Fable 5.1 i deres oppsett.
Every, Dan Shippers selskap, har testet Jev omtrent en uke på skjønnsoppgaver og rapporterer om lag 25 ganger raskere og 600 ganger billigere enn en Fable-nivå-modell. Det er én kundes erfaring, ikke en uavhengig lab-test.
«Kan ikke hallusinere» er en typesak
TypeSafe plotter 0 prosent typefeil fordi schema-treff er garantert. De skriver eksplisitt at tallet ikke er empirisk. The Register påpeker det samme 16. september: Jev kan fortsatt ta feil. Den kan ikke dikte opp et sitat, men den kan gi høy sannsynlighet til feil rute.
Det er poenget for CISO. En hallusinert verktøykall i en agent er ubehagelig. En feil beslutning tre lag ned i en automatisert kjede med latenstak er produksjonsbrudd. Jev fjerner parse-feil. Den fjerner ikke feil skjønn. Kalibrering måles over grupper av prediksjoner, ikke på enkeltkall. TypeSafe sier selv at høyere konfidens skal bety høyere treff, og at det er forutsetningen for automatisering.
Hva dette betyr for ledere
Sett Jev i test som dommer og ruter, ikke som erstatning for frontier-chat. Bruk den der dere allerede har en arbeidsflyt i kode: saksfordeling, tillits-terskel, jailbreak-sjekk, scoring av agentutdata. Behold Astra, Fable eller det dere kjører som System 2 for oppgaver som krever resonnering og tekst.
Ikke ta «output gratis for alltid» inn i treårsbudsjettet uten klausul. TypeSafe sier de forventer at prisen går ned, men de kan ikke bevise bærekraften ennå. 0,042 dollar per million input er et innføringstall for early access, ikke en SLA.
Databehandling: early access, stengte vekter, US-hosting. For EØS-kunder er dette en DPIA-sak før kundesaker, agent-logger eller intern e-post går inn som tilstand. Det finnes ingen publisert selvhost- eller open-weight-sti.
Doom-demoen er strukturert spilltilstand som tekst, ikke bilder. Den er bevis på latenstaket, ikke på at Jev er klar for sanntidsstyring av fysisk utstyr. TypeSafe advarer selv om at 10 kall i sekundet i den demoen koster om lag 7 dollar i timen.
Hvis dere bygger agentfabrikker: spørsmålet er om dere vil eie beslutningsgrafen i kode og kjøpe en billig, typed dommer — eller fortsette å tvinge chatmodeller til JSON. Jev er early access. Mål treff, kalibrering og p95-latens på deres egne saker før den får lov til å stenge en sløyfe.
Kilder og medier
Primærkilde: TypeSafe AI, «Introducing System One Models & Jev», https://typesafe.ai/blog/introducing-system-one-models-and-jev
TypeSafe AI, dokumentasjon, https://docs.typesafe.ai/introduction
The Register, «TypeSafe AI debuts model for machines that plays Doom», https://www.theregister.com/ai-and-ml/2026/09/16/typesafe-ai-debuts-model-for-machines-that-plays-doom/5296711
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.