Uavhengig eval: GLM-5.3 er i frontier-sjiktet, vektene er ikke
Z.ai har nå en annen type bevis enn egne tabeller. 18. august 2026 daterer både selskapets release notes og Artificial Analysis GLM-5.3 som tilgjengelig. Den uavhengige testen setter modellen på 60 i Intelligence Index, delt åttendeplass av 182 modeller. API-en er dokumentert og priset. Vektene ligger fortsatt ikke på Hugging Face.
Det er det som gjør saken operativ. 14. august viste Z.ai egne tall for kode og sårbarhetsjakt og holdt vektene tilbake i to uker. Nå kan innkjøp og arkitektur faktisk kjøre en tredjepartsmålt modell mot egne agentoppgaver. De kan ikke laste den ned og eie den.
Hva tredjeparten faktisk målte
Artificial Analysis tester GLM-5.3 (max) som en resonnerende, proprietær modell. Råscoren er 59,5, vist som 60. Kimi K3 (max) ligger på 59,7. GPT-5.6 Sol (max) på 60,9. GLM-5.3 er altså i samme sjikt som toppene i åpen og lukket klasse, ikke et nivå under.
Andre tall fra samme modellkort, alle uavhengig målt:
- GDPval-AA v2: 1769 Elo, altså reelle kunnskapsarbeidsoppgaver, ikke quiz.
- AA-Omniscience: 14,3. Treffsikkerhet 33,9 prosent. Hallusinasjonsrate 29,6 prosent.
- Terminal-Bench v2.1: 83,9 prosent.
- SciCode: 56,5 prosent.
- GPQA Diamond: 91,7 prosent.
- Humanity's Last Exam: 42,3 prosent.
- AA-LCR: 76,3 prosent.
- τ³-Banking: 50,3 prosent.
Arkitekturen er uendret fra GLM-5.2: 753 milliarder parametere totalt, 40 milliarder aktive, 1 million tokens kontekst. AA merker likevel modellen som proprietary. Lisensfeltet sier MIT, og vektreferansen peker på huggingface.co/zai-org/GLM-5.3. Det repoet svarer 404. Open weights er et løfte, ikke en fil.
Prisen er 1,40 dollar per million input-tokens, 4,40 per million output og 0,26 for cache-treff. Det matcher Z.ai sin egen prisliste. Evalueringen kostet 1238 dollar. Snitt per indekssoppgave: 0,68 dollar. Hastighet: 84,7 tokens per sekund. Verbaliteten er høy: 170 millioner output-tokens gjennom indeksen, mot median 72 millioner. Billig listepris kan bli dyr i agentløp som tenker lenge.
API-en er åpen. Det er ikke det samme som kontroll.
Z.ai sin offisielle modellside sier at GLM-5.3 er tilgjengelig for alle GLM Coding Plan-brukere og via Model API. Endepunktene er OpenAI Chat Completions, OpenAI Responses og Anthropic Messages. Modell-ID er glm-5.3. Kontekst er 1M. Maks output er 128K. Tenkning kan ikke slås av. reasoning_effort er low, high eller max, med max som default.
Migrasjonsfellen er konkret. Applikasjoner som sender thinking.type: disabled feiler. Coding Plan-abonnement, også utløpte, kan foreløpig bare bruke Chat Completions-protokollen. Off-peak og hele helgen koster halv poengkvote i Coding Plan. Standard API-pris er den samme som for GLM-5.2.
Z.ai gjentar egne tall i dokumentasjonen: 50 prosent løft på intern Code Bench, Terminal-Bench 3.0 fra 4,6 til 28,3, DeepSWE v1.1 fra 46,2 til 66,9. På intern Code Bench High slår de Claude Opus 4.8 på treffrate med færre tokens. Claude Fable 5 ligger fortsatt foran på Max. Det er leverandørens målinger. Det nye er at en utenforstående lab nå plasserer samme modell i frontier-sjiktet på et annet sett oppgaver.
Styringsspørsmålet er uendret, bare mer akutt
Z.ai skriver fortsatt at cyberkapasiteten vokste raskere enn planlagt. I egne tester leder GLM-5.3 på CyberGym med 84,5 prosent, foran Mythos 5 og GPT-5.6 Sol. På ExploitBench mer enn dobles GLM-5.2. På ekte kodebaser oppgir selskapet 2436 sårbarheter i 269 prosjekter etter manuell gjennomgang, 1097 av dem middels eller høy alvorlighet.
AA måler ikke den cyberkjeden. De måler arbeid, kunnskap og terminalbruk. For en CISO er skillet viktig. En modell som scorer 60 i generell intelligens og samtidig trenes på exploit-kjeder, skal ikke inn i repo, CI eller produksjonsnære verktøy bare fordi indeksen ser pen ut.
Tre beslutninger bør tas før noen bytter standardmodell:
- Skille evaluering fra produksjon. Kjør GLM-5.3 mot egne agentoppgaver i isolert miljø. Bruk AA-tallene som prioriteringsgrunnlag, ikke som godkjenningsstempel.
- Sett tenkenivå som policy, ikke som utviklervalg. Default
maxgir mer kvalitet og mer tokens. Det treffer både kostnad og angrepsflate. - Ikke planlegg selvhosting på 18. august-løftet. Vektene er ikke ute. En MIT-linje i et evalueringskort er ikke en nedlastbar sjekksum.
For norske virksomheter som vil redusere avhengighet til amerikanske lukkede modeller, er GLM-5.3 nå en reell API-kandidat. Den er ikke en on-prem-kandidat. Den er heller ikke multimodal: dokumentasjonen sier tekst inn, tekst ut. Team som trenger bilde, GUI eller dokumentlayout må holde en annen modell i stakken.
Det praktiske neste steget er kjedelig og riktig. Lag en testharness med de oppgavene dere faktisk betaler for: lang kodejobb, sårbarhetsgjennomgang uten exploit-kjøring, saksbehandling, sitering. Mål treff, hallusinasjon, tokenbruk og om agenten holder seg innenfor verktøypolicy. Sammenlign mot dagens standardmodell på samme harness, ikke mot en skjermdump fra en leverandørblogg.
GLM-5.3 har fått den testen 14. august-lanseringen manglet. Den tåler den. Det som ikke tåler slapp styring, er en billig, pratsom og cybersterk agent med nøkler til kodebasen.
Kilder og medier
Primærkilde: Z.ai, GLM-5.3 modelldokumentasjon, https://docs.z.ai/guides/llm/glm-5.3
Uavhengig evaluering: Artificial Analysis, GLM-5.3 (max), https://artificialanalysis.ai/models/glm-5-3
Supplerende: Z.ai release notes 18. august 2026 og Z.ai prisliste for GLM-5.3.
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.