Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

OpenAI-agenter rammet RubyGems: over 2000 pakker – kalt godartet • Anthropic: Claude-bruddene var alignment-feil, ikke bare sandbox • Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face

Atria Dawn Preview: MIT og 744B – CyberGym først, kode bak Opus
Shanghai AI LaboratoryAtriaAI-modellerÅpne vekterMITAI-agenterCybersikkerhetCIOCISOKoding

Atria Dawn Preview: MIT og 744B – CyberGym først, kode bak Opus

JH
Joachim Høgby
14. september 202614. september 20265 min lesingKilde: Shanghai AI Laboratory

Shanghai Artificial Intelligence Laboratory la 14. september ut Atria Dawn Preview. Det er en agentisk instruert modell bygd på GLM-5.2, et MoE-fundament laben oppgir til 744 milliarder parametre. Vektene ligger åpne under MIT på Hugging Face, uten gating. Navnet sier preview. Det er ikke et ferdig produkt.

For en CIO er skillet viktigere enn «agentisk superintelligens» i arXiv-tittelen. Først: holder labens egne tester utenfor deres tabell. Deretter: hva koster det å kjøre rundt 1,5 TB BF16. Til sist: kinesisk lab, åpne vekter, og et eksplisitt cybersikkerhetsspor som inkluderer å validere sårbarheter.

Hva som faktisk er nytt

Modellkortet internlm/Atria-Dawn-Preview ble opprettet 11. september kl. 08:27 UTC. Offentlig kunngjøring kom 14. september kl. 13:30 UTC fra @AtriaASI. Samme dag gikk arXiv-notatet 2609.15818 inn kl. 16:22 UTC. Kortet ble sist endret 14. september 18:18 UTC.

Laben beskriver fire spor: discovery, creation, delivery og cybersecurity. Siste spor inkluderer å analysere sikkerhetsproblemer, validere sårbarheter, legge inn fiks og re-validere i autoriserte miljøer. Det er labens ord. Ikke en hogby.ai-test.

Kontekst: 256K. Tekst inn, tekst ut. Dokumentasjonen sier rett ut at modellen ikke er multimodal. Språk: kinesisk og engelsk. Lokal kjøring peker mot SGLang fra v0.5.13.post1 og vLLM fra v0.23.0, med GLM-5.2-oppskrifter. Hostet tilgang går via api.atria-asi.ai internasjonalt og discovery.intern-ai.org.cn i Kina. Publisert tokenpris står ikke i modellkortet.

Vektene

BF16-sjekkpunktet har 364 filer. Hugging Face summerer 753,3 milliarder parametre i safetensors. Laben skriver 744B MoE. Forskjellen er telling, ikke to modeller. BF16 tilsvarer rundt 1,5 TB. FP8-varianten internlm/Atria-Dawn-Preview-FP8 kom 12. september, 188 filer, samme totaltall.

Lisensfilen er MIT, copyright 2026 atria-asi. Ingen gating. Det er et klyngevedtak. Ikke en bærbar.

Tallene laben selv oppgir

Alle score under er labens målinger. Ingen uavhengig Artificial Analysis-plassering var publisert da vi sjekket 15. september.

I labens tabell leder Atria fem rader: AutomationBench 53,8, BFCL v4 77,0, CyberGym 86,5, DeepSearchQA 96,0 og BrowseComp 92,5. CyberGym er 3,2 poeng over DeepSeek V4 Pro 0813 og 2,9 over GPT-5.6 Sol. Claude Opus 5 er ikke oppgitt der.

Koding er et annet bilde. Terminal-Bench 2.1: 78,3 mot Opus 5 på 90,2 og Qwen 3.8 Max på 89,3. SWE-bench Pro: 59,6 mot Opus 74,7. JobBench: 50,3 mot Opus 68,0. GDPval: 1583 mot Opus 1768. Workspace-Bench: 65,0, 0,8 under Opus.

Papiret sier konkurransedyktig med frontier-agenter og høyest på fem av 16 tester. Det matcher tabellen. Det matcher ikke en påstand om å slå Opus på programvarearbeid.

Hva papiret faktisk viser

Notatet analyserer 769 oppgaveposter fra 56 deltakere. Deltakerne vurderte om lag en tredel av fullførte AI-assisterte oppgaver som umulige uten AI. Agenter foreslår metoder og implementerer revisjoner. Mennesker tar de fleste endelige beslutningene, ifølge forfatterne.

Det er et prosessnotat om menneske–maskin-samarbeid i labens eget utviklingsløp. Ikke et innkjøpsbevis. Preview-statusen står i navnet.

For CIO og CISO

Åpne MIT-vekter fjerner lisensporten. De fjerner ikke leverandørrisiko. Shanghai AI Laboratory er en kinesisk statsnær lab. Hostet API går via Atria-konsoll. EØS-databehandleravtale og AI Act-rolle er ikke dokumentert i modellkortet.

Cybersikkerhet som produktspor er et styringsspørsmål. En modell som markedsføres for sårbarhetsvalidering, hører hjemme bak samme kontroll som pentest-verktøy. Ikke i en generell kodeagent uten mandat.

Labens CyberGym-seier er ikke en uavhengig red team-rapport. Terminal-Bench og SWE-bench Pro, der Opus leder klart i samme tabell, er det nærmeste laben kommer en ærlig sammenligning på koding.

Hvis du evaluerer: kjør egne oppgaver. Ikke lim inn labens fem førsteplasser i et styrenotat.

Kilder og medier

Primærkilde: Shanghai AI Laboratory / https://huggingface.co/internlm/Atria-Dawn-Preview Kunngjøring: https://x.com/AtriaASI/status/2099490911822794901 Papir: https://arxiv.org/abs/2609.15818 GitHub: https://github.com/atria-asi/Atria-Dawn-Preview Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.