Beam: 501B MoE – 23B aktive, labens eval mot GLM 5.2
Reflection slipper Beam 5. oktober. 501 milliarder parametere totalt, 23 milliarder aktive per token. Sparse MoE. Tekstmodell, ikke multimodal. Pretrening 23,8 billioner tokens. Kontekst opptil 1 million tokens etter midttrening.
Vektene er ikke ute. Early access går via venteliste på platform.reflection.ai. Apache 2.0, teknisk rapport, modellkort og utviklerstack kommer senere i oktober. Det er en kunngjøring, ikke en nedlasting du kan sette i produksjon i kveld.
Hva laben måler
Tallene under er Reflections egne, i labens harness. Ingen uavhengig Artificial Analysis-plassering.
SWE-Bench Verified: 80,9. SWE-Bench Pro v1: 65,5. SWE-Bench Pro v2-Hard: 77,2. Terminal-Bench v2.1: 80,1. DeepSWE v1.1: 44,4. SWE-Bench Multilingual: 78,0. SWE Atlas Codebase QnA: 34,6.
Sammenligningen laben selv setter opp på DeepSWE: Beam 44,4 mot GLM 5.2 44,0, GLM 5.3 61,0, Kimi K3 68,0, Qwen 3.8 Max 51,0 og DeepSeek V4.1 Flash 74,2. Terminal-Bench: 80,1 mot GLM 5.2 81,0, GLM 5.3 88,2 og DeepSeek 90,6. Kimi K3 ligger foran på rå kapabilitet. Beam sin påstand er inferens-effektivitet, ikke at den leder tabellen.
Laben sier Beam matcher GLM 5.2 på avansert resonnering med 3–4 ganger mindre inferenscompute. Estimatet er FLOPs ≈ 2 × aktive parametere × genererte tokens, uten prefill, attention og serving. Det er ikke målt tokendollar og ikke en skypris.
Brukere kan styre resonneringsinnsats. Lavere innstilling gir kortere svar. Høyere innstilling bruker flere tokens på krevende oppgaver. Laben beskriver to faser i RL: først mer treffsikkerhet med færre tokens, deretter lengre kjeder når agentiske oppgaver krever det.
Hva det betyr for CIO og CISO
Beam er posisjonert som vestlig åpen vekt mot kinesiske åpne modeller, ikke mot Claude eller GPT i chat. Reflection er Brooklyn-basert, grunnlagt 2024 av tidligere DeepMind-forskere. TechCrunch: rundt 4,7 milliarder dollar reist, 25 milliarder i pre-money. NVIDIA, Sequoia og Lightspeed. Computeavtaler med SpaceX og Nebius på over 7 milliarder dollar gjennom 2029.
For innkjøp: vektene kommer senere. Ingen allmenn hosted API i dag. Tekstmodell. Inkling fra Thinking Machines er multimodal; Beam slår Inkling på fire kodetester der begge rapporterer, ifølge labens tabell. Det er ikke en erstatning for visjon eller tale.
Sikkerhetsevalene er ikke publisert. Laben lover dem i den tekniske rapporten og sier den vil åpne interne sikkerhetsevalueringer. Alignment er tre lag: regler som ikke skal brytes, kvaliteter som skal holdes, og stil. Deliberative alignment og adversariell SFT. Inntil rapporten ligger ute: ikke sett dette som ferdig CISO-dokumentasjon.
RL-kjøringen: 10 500 NVIDIA GB300 i fire uker, over 100 millioner rollouts, 256k kontekst i RL, rundt 1,3 milliarder sandkasser. Pretrening: 6 144 GB300 NVL72, under fire uker, 92,3 prosent goodput mot slutten. Ni semi-automatiske rewinds. Det er labens infrastrukturfortelling. Det forteller mer om kapasitet enn om at du kan kjøre 501B on-prem i morgen.
Pitch mot suverene kunder er «AI factories»: tren på egne data, kjør lokalt. Shinsegae i Sør-Korea er nevnt som tidlig spor. Det er partnerskap, ikke en ferdig on-prem-pakke med SLA.
Begrensninger
Evalene er labens. Sammenligningssettet har hull merket NR. Ingen AA-index. Vektene er ikke lastet opp. Systemkort og sikkerhetstall kommer senere. Compute-estimatet ekskluderer prefill. Tekst-only. Early access er venteliste. Apache 2.0 er varslet, ikke levert.
Kilder og medier
Primærkilde: Reflection, «Introducing Beam: Reflection’s 501B open-weight model», 5. oktober 2026. https://reflection.ai/blog/introducing-beam
Supplerende: TechCrunch, «Reflection debuts Beam, an open-weight AI model to rival Chinese models at lower compute cost», 5. oktober 2026. https://techcrunch.com/2026/10/05/reflection-debuts-beam-a-open-weight-ai-model-to-rival-chinese-models-at-lower-compute-cost/
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.