Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face • Bloomberg: NVIDIA-kunder varsles om over 15 prosent prishopp på AI-servere • OpenAI kutter GPT-5.6 Sol mer enn 20 prosent – i tre måneder

Z.ai legger navn på Ox Alpha: GLM-5.3-Flash under MIT
AI-modellerZ.aiGLMOpen WeightsKodeagenterCIOCISO

Z.ai legger navn på Ox Alpha: GLM-5.3-Flash under MIT

JH
Joachim Høgby
26. august 202626. august 20266 min lesingKilde: Z.ai

Z.ai la 26. august 2026 navn på stealth-modellen som har kjørt gratis i kodeagenter siden 20. august. Ox Alpha er GLM-5.3-Flash: 320 milliarder parametre totalt, 18 milliarder aktive, nativt multimodal, én million tokener kontekst. Vektene ligger på Hugging Face under MIT-lisens. API-koden er glm-5.3-flash.

For CIO og CISO er dette oppfølgingen av Ox Alpha-saken, ikke en ny lab-hype. Leverandøren er kjent. Lisensen er liberal. Inferensen i den anonyme uken gikk på kinesiske AI-brikker. Det siste endrer datastyringen mer enn MIT-linjen.

Hva som ble sluppet

GLM-5.3-Flash er den første nativt multimodale modellen i GLM-5-serien. Tekst, bilde og video inn. Tekst ut. Maks output er 131 072 tokener ifølge modellkortet som sirkulerte som Ox Alpha. Z.ai sier den slår GLM-5.2 på tvers av benker til en tidel av prisen, og nærmer seg Claude Opus 4.8 på koding og agentarbeid.

Arkitekturen er ny i GLM-familien. Hybrid lineær og sparsom oppmerksomhet skal kutte langkontekst-kostnad. Manifold-Constrained Hyper-Connections (mHC) skal gi mer ut av pretreningen. Mot GLM-5.3 oppgir laben 3,0 ganger lavere oppmerksomhetsregning og 4,4 ganger mindre KV-cache. Lagtallet er 45 mot 92. Aktive parametre er 18B, mot 32B i GLM-4.5-klassen. Fortreningen er 30 billioner multimodale tokener.

Z.ai bekrefter at uken som ox-alpha på OpenCode og OpenRouter var en tilsiktet test. All trafikken ble servert på kinesiske akseleratorer, med egen SGLang-stack, Encode–Prefill–Decode-disaggregering og W8A8-kvantisering. Labens mål er kostnad per token på linje med NVIDIA-GPU. Det er et suverenitetsargument for Beijing, og et residensproblem for europeiske kunder som lot kildekode gå gjennom stealth-endepunktet.

Vektene støtter SGLang, vLLM, TokenSpeed og KTransformers. Coding Plan-brukere får tre ganger kvoten mot GLM-5.3. I ZCode skal Browser Use og Computer Use bruke synet til å klikke, se og verifisere. Anbefalte API-parametre er temperature 1, top_p 0,95 og reasoning_effort max. Tenkemodus kan ikke slås av.

Tallene er Z.ais egne

På labens tabell leder Flash GDPval-AA v2 med 1773, foran Claude Opus 4.8 på 1582 og GPT-5.6 Terra på 1571. AutomationBench v1.0.6: 48,8 mot Opus 41,0, mens Gemini 3.7 Flash ligger foran på 52,3. Terminal Bench 2.1: 84,3 mot Opus 85,0 og Terra 87,4. DeepSWE v1.1: 63,4 mot GLM-5.2 46,2 og Opus 58,0. Intern Z.ai Code Bench v1.0 på maks innsats: 29,0 mot Opus 29,5.

OfficeQA Pro 62,4, foran Opus 48,9. CharXiv Reasoning med verktøy 89,4, i nærheten av Opus 89,9. BabyVision 53,4, bak Gemini 3.7 Flash på 70,9. Flere synsrader er labens egne oppsett, med ulike kontekstvinduer og billedstørrelser.

Artificial Analysis Intelligence Index v4.1.1: 57 poeng til 0,045 dollar per oppgave på rabattert trinn, ifølge Z.ai. Det er labens Pareto-påstand, ikke et innkjøpsbevis. Flere rader er interne eller kjørt i Claude Code-harness. Fotnotene viser 6-timers timeout, 400K kontekst på DeepSWE og GPT-5.6 Luna som dommer på HLE. Behandle tabellen som produsentmåling. Vent på uavhengig lederboard før dere bytter default-modell.

MIT åpner vektene. API-et åpner Kina.

MIT betyr at dere kan kjøre, endre og selge derivater uten Qwen-stil MaaS-klausul. Det er den praktiske forskjellen mot Qwen3.8-Flash-Next, som hogby dekket samme dag. Intern PoC bak brannmur er juridisk enklere. 320B MoE er likevel et rack, ikke en bærbar.

Hostet API er noe annet. Den anonyme uken gikk på kinesiske brikker. Personopplysninger og kildekode som gikk gjennom stealth/ox-alpha, bør behandles som sendt til Z.ai, ikke som «zero retention» fra OpenCode-markedsføringen. Nå finnes navn, prisflate og jurisdiksjon. Dere kan be om databehandleravtale. Dere kan også la være å bruke API-et og hoste selv.

Ikke bland Flash med flaggskipet. GLM-5.3 fra 14.–18. august er den store kode- og cyberagenten, med vekter som fortsatt ventet. GLM-5.3-Flash er den billige multimodale MoE-en som faktisk kan lastes ned denne uken. SiliconANGLE bekrefter slippet og MIT-vektene. De gjengir også labens GDPval- og AutomationBench-påstander. Uavhengig eval av Flash er ikke lederboard ennå.

Hva ledelsen bør gjøre

Opphev stealth-blokken bare der kinesisk lab er en besluttet, tillatt leverandør. Bytt modell-ID fra stealth/ox-alpha til glm-5.3-flash eller til egenhostede vekter. Anta at kode sendt i gratisuken allerede ligger hos Z.ai. Ikke bytt Claude eller GPT på Z.ais GDPval-rad. Skill tre spor: intern MIT-hosting, Z.ai API, og den anonyme uken som allerede har skjedd. Bare det første er under deres kontroll.

Kilder og medier

Primærkilde: https://z.ai/blog/glm-5.3-flash Kilde: Z.ai, blogg 26. august 2026. Modellkort: https://huggingface.co/zai-org/GLM-5.3-Flash. API-dokumentasjon: https://docs.z.ai/guides/vlm/glm-5.3-flash. SiliconANGLE, Maria Deutscher, 26. august 2026: https://siliconangle.com/2026/08/26/z-ai-open-sources-ox-alpha-model-as-glm-5-3-flash/ Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.