OpenAI Jalapeño: første målinger viser mer inferens per watt enn NVIDIA
OpenAI har publisert de første målte resultatene for Jalapeño, selskapets første egenutviklede inferenschip. Tallene kom 25. august 2026, i forbindelse med Hot Chips. Dette er ikke en ny modell. Det er målinger av hvor raskt og billig tre kjente modeller kan serveres. For CIO og CISO er det likevel modellnyhet: latenstid, kapasitet og tokenkost på ChatGPT, Codex og agenter styres nå av silisium OpenAI selv designer.
Primærkilden er OpenAIs egen tekniske rapport. Chipen er testet på SemiAnalysis’ åpne InferenceX-benchmark mot kommersielt tilgjengelige NVIDIA-systemer. Modellene er GPT-OSS 120B, DeepSeek R1 670B og Kimi K2.5 1T. På alle tre leverer Jalapeño 1,5 til 1,9 ganger mer AI-arbeid per watt ved topp gjennomstrømning, og 1,7 til 3,6 ganger lavere ende-til-ende-latenstid. På svært interaktive laster er ytelsen 2,1 til 4,1 ganger høyere.
Hva tallene faktisk viser
OpenAI insisterer på å måle nyttig arbeid per watt ved matchet brukeropplevelse, ikke «per chip». Jalapeño er oppgitt til 700 watt. Målt vedvarende effekt lå på eller under 550 watt i testene. Sammenligningen er GB200 på 1 200 watt for GPT-OSS og GB300 på 1 400 watt for DeepSeek R1 og Kimi.
På GPT-OSS 120B: om lag 1,9 ganger høyere topp mixed tokens per sekund per kilowatt (85 448 mot 44 960), 1,03 sekund latenstid mot 1,80, og 1 459 mot 535 tokens per sekund per bruker. På DeepSeek R1: 1,7 ganger mer arbeid per watt, 1,65 sekund mot 5,99, og 700 mot 169 tokens per bruker. På Kimi K2.5 1T, den største offentlige modellen i testen: 1,5 ganger mer per watt og 3,4 ganger lavere latenstid.
De oppsiktsvekkende 54x til 104x-tallene gjelder ikke topp mot topp. De gjelder gjennomstrømning per kilowatt ved den forrige beste tid-mellom-tokens. Det er et valgt arbeidspunkt. Bruk det som illustrasjon av lav latenstid, ikke som innkjøpsmultiplikator.
Jalapeño er bygd for å holde KV-cache og modelltilstand lokalt, og for å skifte mellom prefill (compute) og decode (minnebåndbredde) uten å tape tid på databevegelse. Agenter gjør mange steg i serie. Forsinkelse summeres. Det er poenget OpenAI selger, ikke en ny evne i selve modellen.
Hva som ikke er sagt
Chipen trener ikke. OpenAI er fortsatt avhengig av NVIDIA, AMD og andre for trening og for det meste av inferens. Richard Ho, sjef for hardware, sa det rett ut: Jalapeño er én brikke i en portefølje som også inkluderer Cerberus, NVIDIA og AMD. Systemene skal inn i OpenAIs egen infrastruktur i små volum mot slutten av 2026, med oppskalering i 2027. Chipen selges ikke. Ho sa at intern etterspørsel er så stor at de ikke ser for seg å selge den til andre.
Tallene er OpenAIs. SemiAnalysis har verifisert noen kjøringer på lab. Teknisk presse (TechCrunch, Axios, The Verge) dekker saken som første offentlige måling, ikke som uavhengig bake-off mot Rubin-racks som allerede sendes til kunder. The Decoder peker på at NVIDIA og AMD har publisert tall på nyere modeller som DeepSeek V4 Pro og Kimi K3, som ikke er testet på Jalapeño ennå. Førstegenerasjons ASIC mot skipsmoden GPU-plattform er ikke samme leveranse.
OpenAI brukte egne modeller i designløkken. Selskapet sier ni måneder fra første design til tapeout, og at Codex med GPT-Astra fikk tre åpne modeller som ikke sto i originalplanen opp på høy ytelse på to måneder. For utvalgte GPT-OSS-blokker skal AI-genererte kjerner ha kjørt 1,5 til 1,8 ganger raskere enn menneskeskrevne. Det gjelder blokker, ikke hele modellen.
Gen 2 er langt i utvikling. Gen 3 tar form. Jalapeño er første generasjon i en flerårig plattform, utviklet med Broadcom.
Hva norske ledere bør gjøre med dette
Du kan ikke kjøpe Jalapeño. Du kan kjøpe konsekvensen: OpenAI designer modell, serving-programvare, minne, nett og rack som ett system. Det treffer tre styringsspørsmål.
1. Latenstid i agentflater. Hvis Codex, ChatGPT Work og interne agenter er i produksjon, er tid mellom tokens ikke en demo-metrikk. Det er syklustid. Lavere latenstid uten å ofre gjennomstrømning er det OpenAI hevder å ha løst i én arkitektur. Be om SLA på interaktiv last, ikke bare tokens per dollar i batch.
2. Kostnad og kapasitet, ikke eierskap. Mer arbeid per watt kan gi lavere servingkost og mer kapasitet når etterspørselen vokser. Det er OpenAIs operasjonelle gearing, ikke din. Du får ikke HBM4-racks i kjelleren. Du får potensielt raskere svar og færre køer i OpenAIs sky, hvis volumet faktisk kommer i 2027.
3. Leverandørkonsentrasjon. Full stack hos én lab reduserer NVIDIA-avhengighet for OpenAI. For kunden kan det øke avhengighet av OpenAI. Trening, eksportkontroll og reservedeler ligger fortsatt hos GPU-leverandørene. En ASIC du ikke kan kjøpe, er ikke en exit-strategi. Den er en påminnelse om å ha modellvalg og residens på papiret før du låser arbeidsflyt til ett inferenslag.
Bokfør saken som målt inferens, ikke som modellslipp. Følg etter når OpenAI viser produksjonsvolum, uavhengige InferenceX-kjøringer mot Vera Rubin, og om fordelen holder på nyere åpne modeller. Inntil da: les tokenpris, køtid og agent-SLA. Ikke les 104x som budsjettlinje.
Kilder og medier
Primærkilde: OpenAI, «Jalapeño’s first results show industry-leading speed and efficiency in AI inference», 25. august 2026: https://openai.com/index/jalapeno-first-results/
Sekundært: TechCrunch, 25. august 2026; Axios, 25. august 2026; The Verge, 25. august 2026.
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.