Cantina Apex Flash-1: 40 av 60 – MIT, abliterert kopi ute
Cantina Security og Yeta Labs slipper 1. oktober apex-flash-1. Det er en MIT-lisensiert finjustering av Z.ai sin GLM-5.3-Flash, lagt åpent på Hugging Face. Målet er ikke en ny frontmodell. Målet er en billig arbeider-modell for sikkerhetsagenter: lese kode, bruke verktøy, og verifisere funn mot et kjørende mål.
Tallet som selger saken, er labens eget. 60 oppgaver fra 20 holdte-ute sårbarhetscase. Første trekk, pass@1, etter manuell gjennomgang:
Opus 5 High: 43 av 60, 71,7 prosent, 74,68 dollar. apex-flash-1: 40 av 60, 66,7 prosent, 2,38 dollar. GLM-5.3-Flash: 36 av 60, 60,0 prosent, 4,56 dollar.
Det er ikke Artificial Analysis. Det er ikke CAISI. Det er Cantinas harness, Cantinas case, Cantinas verifier. Fire oppgaver forbi basen. Tretti ganger billigere enn Opus 5 High på samme sett. Det er nok til at CISO må merke det, og for lite til å kalle det en uavhengig rangering.
Hva som faktisk er trent
Treningen er GRPO på 150 oppgaver fra 50 case. Rank-256 LoRA på alle eksperter og rutere, pluss full oppdatering av 16 eksperter. Full oppdatering av alle eksperter kollapset i deres forsøk. De kalibrerer vanskelighet slik at noen løp lykkes og noen feiler. Ellers gir gruppesignalet ingenting.
Hver case har tre visninger: veiledet hvitboks, fokusert hvitboks og fokusert svartboks. Treningsmiksen er skjev: 72 prosent autorisasjon, identitet og scope-binding. Resten er tallpresisjon, tids- og signaturvalidering, forretningsregler og SSRF. Det er app- og API-feil, ikke Chrome-V8-kjeder.
Modellen er tenkt som arbeider under en større orkestrator. Cantina anbefaler Codex-harness for dette sjekkpunktet. Arkitekturen er den samme multimodale GLM-5.3-Flash. Evalen dekker bare tekst. Bilde og video er ikke målt.
Vektene er BF16, rundt 321 milliarder parametere. Sjekkpunktet er sharded og tungt. Det er ikke en laptop-modell. MIT, ugatet.
Abliterert kopi uten egen måling
Samme dag ligger apex-flash-1-abliterated på Hugging Face. Cantina skriver at nektelsesendringen ikke er begrenset til sikkerhetsoppgaver. Varianten har ikke fått egen full eval. Tallene over gjelder standardvektene.
Det er poenget for styring. Anthropic viste 29. september at abliteration tok GLM-5.3-refusals mot null. Her kommer ferdig ablitererte vekter fra utgiveren, under MIT, uten sandkasse og uten vetting. Glasswing-modellen gjelder ikke.
Hva dette betyr for CISO
GLM-5.3 var allerede den mest cyberkapable åpne vekten CAISI hadde målt. Apex Flash-1 er ikke et sprang i evne. Det er et sprang i tilgang og pris: samme familie, trent på produksjonslignende sårbarheter Cantina sier de har funnet og fått betalt for, pakket som arbeider-agent, 2,38 dollar for 60 oppgaver i labens eget sett.
For norsk virksomhet er tre ting konkrete.
- Anta at åpne vekter med exploit-arbeid er nedlastbare og lokale. API-policy og leverandørens acceptable use stopper ikke den som kjører vektene selv.
- Interne rødteam og leverandører som finjusterer åpne modeller, trenger isolasjon, logging og forbud mot produksjonsmål. En arbeider-modell under orkestrator er nettopp det som skalerer scanning.
- Patch og SBOM mot autorisasjon og identitet i egne apper teller mer enn neste Intelligence Index-poeng. 72 prosent av treningsmiksen sitter der.
Ikke les 66,7 prosent som at Cantina har tatt igjen Opus. Les det som at gapet på labens egne case er fire oppgaver, og at kostnaden er falt under tre dollar. Uavhengig plassering mangler. Evnen og vektene gjør ikke det.
Kilder og medier
Primærkilde: Cantina, «Introducing Apex Flash-1»: https://www.cantina.security/apex-flash
Modellkort: Hugging Face, cantina-security/apex-flash-1 (MIT), og den ablitererte derivaten cantina-security/apex-flash-1-abliterated.
Korroborering: Anthropic, «GLM-5.3 and the spread of advanced cyber capabilities», 29. september 2026: https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.