Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

OpenAI-agenter rammet RubyGems: over 2000 pakker – kalt godartet • Anthropic: Claude-bruddene var alignment-feil, ikke bare sandbox • Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face

Z.ai gjør GLM-5.3 til kode- og cyberagent
Breaking
AI-modellerKodeagenterCybersikkerhetOpen weightsEnterprise AI

Z.ai gjør GLM-5.3 til kode- og cyberagent

JH
Joachim Høgby
14. august 202614. august 20265 min lesingKilde: Z.ai

Z.ai har lansert GLM-5.3, en ny versjon i GLM-5-serien med tydelig retning: mer autonom kodearbeid, sterkere agentoppgaver og et uvanlig skarpt hopp i cyberkapasitet. Dette er ikke presentert som en helt ny grunnmodell. Z.ai sier selv at GLM-5.3 bruker samme basismodell som GLM-5.2, og at fremgangen kommer fra mer post-trening på lange, kjørbare arbeidsmiljøer.

Det høres teknisk ut. For en leder er oversettelsen enkel: modellen er trent mer på hele arbeidsløp, ikke bare på svar. Den skal kunne stå i en utviklingsoppgave over tid, lese kodebaser, kjøre tester, rette feil og optimalisere uten at mennesket må dele jobben opp i små biter hele veien. Det er akkurat denne typen modell som gjør AI fra assistent til faktisk operatør. Og det er også derfor den må vurderes med mer enn bare benchmark-feiring.

Z.ai hevder at GLM-5.3 gir rundt 50 prosent forbedring over GLM-5.2 på selskapets egen Z.ai Code Bench. På offentlige og semi-offentlige agentmålinger viser lanseringsmaterialet store løft: Terminal-Bench 3.0 går fra 4,6 til 28,3, DeepSWE v1.1 fra 46,2 til 66,9, AutomationBench fra 26,2 til 48,2 og Agents' Last Exam fra 23,8 til 28,5. Tabellen viser også at GLM-5.3 ligger i nærheten av de lukkede toppmodellene på flere agentiske kodeoppgaver, selv om Fable 5 og GPT-5.6 Sol fortsatt er sterkere på enkelte tunge kode- og exploit-målinger.

Det mest interessante, og mest krevende, er cyberdelen. Z.ai skriver at sårbarhetsdata og miljøer ble lagt inn i post-treningen, og at cyberkapasiteten utviklet seg raskere enn forventet. På CyberGym oppgis GLM-5.3 til 84,5 prosent, foran både Fable 5 med fallback og GPT-5.6 Sol i selskapets tabell. På ExploitBench mer enn dobles GLM-5.2-resultatet fra 24,4 til 54,4. På ExploitGym fullfører modellen 105 oppgaver innen to timer og 130 innen seks timer, mot 29 og 39 for GLM-5.2.

Dette er ikke bare en teknisk fotnote. Når en modell blir bedre til å bygge komplett exploit-kjede, endrer risikobildet seg. Samme kapasitet som hjelper et sikkerhetsteam med å finne gamle sårbarheter, kan også gjøre uautoriserte aktører raskere. Z.ai forsøker å adressere dette med en kontrollert utrulling: modellen er tilgjengelig nå via GLM Coding Plan og ZCode, mens bredere API-tilgang og åpne vekter kommer i steg etter sikkerhetsevaluering. I bloggposten sier selskapet at vektene skal slippes offentlig om rundt to uker, etter sikkerhetsvurdering og hardening.

For virksomheter er dette skillet viktig. GLM-5.3 er på vei inn i open-weights-landskapet, men er ikke fullstendig frisluppet på lanseringsdagen. Det gir en kort testperiode der CIO og CISO bør avklare policy før utviklere kobler modellen til repoer, terminaler, interne dokumenter og produksjonsnære miljøer. Spørsmålet er ikke bare om modellen er god. Spørsmålet er hva den får lov til å gjøre.

Z.ai har også publisert konkrete API-endringer. GLM-5.3 støtter tre tenkenivåer: low, high og max. Å slå av tenkning er ikke lenger støttet. Applikasjoner som bruker thinking.type disabled må endres før modellbytte, ellers feiler forespørselen. Det er en liten migrasjonsdetalj, men en typisk felle for team som ruter modeller automatisk uten god nok testgate.

Tilgjengeligheten er også mer plattform enn ren modell. GLM Coding Plan støtter GLM-5.3, GLM-5-Turbo og GLM-4.7. Eldre forespørsler til GLM-5.2 og GLM-5.1 skal rutes automatisk til GLM-5.3 i planmiljøet. Planen bruker poengbasert kvote, med egne multiplikatorer for input, cachet input og output. Off-peak-bruk prises til halv poengkostnad. ZCode blir dermed en kontrollflate for lange kodeoppgaver, med Goal mode, cache-effektivitet og fjernstyring av langkjørende jobber.

Den strategiske lesningen: GLM-5.3 er et nytt press på amerikanske lukkede modeller, men ikke bare på pris. Z.ai går rett på de områdene der enterprise faktisk betaler: agentisk engineering, lange oppgaver, terminalarbeid og sikkerhet. Hvis tallene tåler uavhengig testing, blir GLM-5.3 en kandidat for selskaper som vil ha mer forhandlingsmakt mot lukkede leverandører, eller som vil teste selvhostet og regionkontrollert agent-AI når vektene kommer.

Men den praktiske anbefalingen er nøktern. Ikke bytt standardmodell i agentflåten bare fordi en tabell ser sterk ut. Start med isolerte kodebaser, ingen produksjonsnøkler, ingen skriveadgang til kritiske systemer og tydelig logging av tool calls. La sikkerhetsteamet teste både nyttige og farlige scenarioer: sårbarhetsfunn, patchforslag, exploit-rekonstruksjon, hemmelighetshåndtering og forsøk på å omgå domene- eller verktøypolicy.

GLM-5.3 viser hvor fort modellenes arbeidsevne flytter seg fra tekst til handling. Det er bra nytt for team som drukner i backlog, teknisk gjeld og sikkerhetsarbeid. Det er dårlig nytt for organisasjoner som fortsatt behandler modellvalg som et innkjøpsspørsmål alene. Her må styring, evalueringsløp og tilgangsgrenser være klare før utviklerne får en ny, sterkere agent i terminalen.

Kilder og medier

Primærkilde: Z.ai, GLM-5.3: Frontier Coding with Emergent Cyber Capabilities, https://z.ai/blog/glm-5.3

Supplerende verifisering: Z.ai Developer Documentation for GLM Coding Plan and pricing.

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.