Kolibri: 78B Apache – 3,46B aktive, labens eval mot Qwen 3.6
Aleph Alpha slipper Kolibri 3. oktober, tysk nasjonaldag. 78,1 milliarder parametere totalt, 3,46 milliarder aktive per token. Apache 2.0. Vektene ligger på Hugging Face som Aleph-Alpha/Kolibri-1.
Det er en tospråklig tysk-engelsk MoE, trent fra bunnen i Tyskland og Finland. 768 NVIDIA B200, 21 dager pretrening, 20 billioner tokens. Midttrening 3,44T. Lang kontekst 201B. Kunnskapskutt 18. juni 2026. Maks 1 048 576 tokens; laben anbefaler 262 144 i produksjon. FP8-vektene tar rundt 78 GB. Minimum: to A100 80 GB, to H100, eller én H200, B200 eller B300.
Hva laben måler
Tallene under er Aleph Alphas egne, i labens harness, med høyeste resonneringsinnsats.
AIME 2025: 96,9. AIME 2026: 96,0. GPQA Diamond: 84,3. LiveCodeBench v6: 85,9. HumanEval+: 92,7. AA-LCR: 68,3. BFCL v4: 61,4. τ²-bench telecom: 94,7. τ³-bench banking: 38,1. AA-Omniscience Index: −32,8.
Sammenligningssettet er Qwen3.6-35B-A3B, Nemotron 3 Super 120B-A12B og Mistral Small 4 119B-A6B. Mot dem leder Kolibri på matte og GPQA. Qwen3.6 leder på BFCL (67,2 mot 61,4), telecom (99,1 mot 94,7) og LongBench Pro (70,8 mot 64,5). Qwen3.8, GLM-5.3 og MiMo-V2.6-Pro er ikke i den tabellen.
Labens aggregat: 75,5 engelsk og 70,8 tysk. I den større tabellen ligger Qwen3.8 27B på 80,2 og 79,9. Det er fortsatt labens summer.
Uavhengig plassering
Kolibri er ikke på Artificial Analysis Intelligence Index ennå. Trending Topics peker på at Qwen3.6 scorer 18 der, Nemotron 3 Super 13 og Mistral Small 4 11. Hvis Kolibri ligger rundt Qwen3.6, er 15–20 et realistisk intervall. Toppen åpne vekter ligger på 44–46 (Kimi K3, GLM-5.3, MiMo-V2.6-Pro). Det er ikke samme vektklasse. Heller ikke i 3–6B aktive: Qwen3.8-Flash-Next scorer 40 med 6B aktive.
Laben sier offentlige benchmarks treffer dårlig. Egne vertikaler: tysk offentlig sektor 75,0 (Nemotron 78,0), aerospace 58,9, bilunderleverandør 99,0, halvleder 80,4. Honeypot, agentisk RAG, 80,8 mot Nemotron 68,8. Dette er kundemål, ikke åpne sett.
Hva det betyr for CIO og CISO
Suverenitet er salgsargumentet, ikke frontier. Modellkortet sier at Kolibri er for systemer der et menneske leser svaret før handling, ikke for usuperviserte agenter. Merlin-Arthur-trening skal lære den å si «jeg vet ikke». På AA-Omniscience avstår den på 44 prosent av oppgavene mot Origins 15. Qwen3.6 avstår mer: 56,7. Index −32,8 er svakere enn Qwen3.6 (−15,3).
Vektene er Apache. Inferensen er det ikke. Kolibri krever pakken aleph-alpha-inference og en vLLM-plugin med egne reasoning- og tool-parsere. Container: ghcr.io/aleph-alpha/aleph-alpha-inference. Uten den stakken er vektene vanskelige å kjøre. Bindingen sitter i runtime, ikke i lisensen.
Maskinvare: 78 GB i minne selv om bare 3,46B er aktive. To A100 80 GB er minimum. On-prem for den som har H100 eller H200, ikke en laptop-modell. Energiforbruk for pre-, midt- og langkonteksttrening er estimert til 950 MWh, uten SFT og RL.
Aleph Alpha har en bindende fusjonsavtale med Cohere. dpa og Zeit beskriver det som de facto oppkjøp. Heidelberg skal bli forskningshub. For innkjøp: avklar hvilken juridisk enhet som eier vektene, support og eventuelle enterprise-tillegg etter fusjonen. Schwarz/STACKIT er nevnt som sky-spor.
Ingen allmenn hosted API i lanseringen. Last ned, eller kontakt salg for spesialisering. GPAI Code of Practice er signert. Sufficiently Detailed Summary ligger som PDF.
Begrensninger
Evalene er labens. Sammenligningsmodellene er fra våren. Ingen uavhengig AA-score. Tysk andel 21,3 prosent av pretrening, men rundt 1T av de tyske tokenene er omskrivninger, ikke nye kilder. Oversettelse ble brukt sparsomt. Tokenizer UniBPE komprimerer tysk bedre enn GPT-5, Gemini og Qwen i labens test. Det er bytes per token, ikke kvalitet.
Kilder og medier
Primærkilde: Aleph Alpha, «Kolibri Has Landed: A Sovereign Open-Weight Model», 3. oktober 2026. https://aleph-alpha.com/en/blog/kolibri-has-landed-a-sovereign-open-weight-model/
Modellkort: Aleph-Alpha/Kolibri-1. https://huggingface.co/Aleph-Alpha/Kolibri-1
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.