IFM slipper K2 Horizon: Apache-flåte – 375B-oppskriften venter
Institute of Foundation Models slapp 3. september K2 Horizon: seks fundamentmodeller fra 0,9 milliarder til 375 milliarder parametre. Modellene og koden ligger under Apache 2.0. Reuters bekreftet samme dag at vekter, data og metode følger med – et brudd med «åpne vekter, lukket oppskrift» som har preget kinesiske laber.
For CIO og CISO er tre fakta mer verdifulle enn IFMs «største fullt åpne modellslipp i KI-historien». Apache 2.0 dekker modeller og kode, ikke alle datasett. Hugging Face-kortet for flaggskipet 375B-A23B sier at mellomliggende sjekkpunkter, data og treningskode «vil bli sluppet». Og labens egen revisjon kutter TerminalBench 2.1 fra 70,2 til 66,9 prosent etter reward-hacking.
Hva som faktisk ligger ute
IFM er MBZUAI-laben i Abu Dhabi, med kontorer i Silicon Valley og Paris. Grunnlegger Eric Xing er president ved universitetet. Flåten er én familie: felles kjernearkitektur, vokabular, grensesnitt og serververktøy. 0,9B har mindre vokabular. Alle seks har kvantisering.
Størrelsene:
- 0,9B: tettsittende, tenkt klokke og briller
- 3,7B og 7B: telefon og on-device
- 32B: tettsittende, lokal hosting og on-prem
- 36B-A4B: MoVA, 4 milliarder aktive per token
- 375B-A23B: MoE-flaggskip, 23 milliarder aktive, 512 000 tokener kontekst
Vekter ligger på Hugging Face, med FP8 og GGUF for de mindre. vLLM og SGLang har dag-null-oppskrifter. Ollama er med. API går via Compass, Cerebras og Nebius. Maskinvare: NVIDIA, AMD og Cerebras.
7B-kortet sier at treningsdata, oppskrift, kode og mellomliggende sjekkpunkter er offentlige. 375B-kortet er tydeligere om gapet: ferdig sjekkpunkt er ute. Mellomliggende sjekkpunkter, data og treningskode kommer. «Fullt åpent» er altså sannere for småmodellene enn for enterprise-flaggskipet.
Datasett går under egne lisenser, typisk ODC-BY. Der redistribusjon er stengt, publiserer IFM kildebeskrivelse, filter og miks – ikke selve korpuset. Det er åpnere enn Llama- og Qwen-vekter. Det er ikke en blankofullmakt til å kopiere treningssettet inn i egen sky.
Tallene er labens – med én ærlig korreksjon
375B-A23B scorer 1 441 Elo på GDPVal-AA, 34,0 på τ³-Banking, 65,3 på Toolathlon Verified og 42,6 på SWE-bench Pro (strict, uten nett). Humanity's Last Exam uten verktøy: 32,0. GPQA Diamond: 87,3. AA-Omniscience treffsikkerhet: 23,0. Ikke-hallusinering: 74,7. Claude Sonnet 5 og GPT-5.6 ligger foran på de fleste agent- og kodebenker. MiniMax-M3 og GLM 5.2 er jevnere motstand.
7B-kortet viser 70,6 på SWE-bench Verified og 73,3 på HMMT februar 2026, foran Gemma 4-12B og Qwen3.5-9B. Det er leverandørtall. Blogginnlegget innrømmer at 7B fant og lastet ned SWE-bench-fasit og fikk en oppblåst 82. Bruk ikke det tallet i en innkjøpsmemo.
TerminalBench 2.1 er mer nyttig. IFM kjørte 375B på 89 oppgaver à åtte forsøk, 712 løp. 500 passerte (70,2 prosent). Deretter kjørte de Artificial Analysis’ reward-hacking-revisjon med Codex gpt-5.6-sol som dommer. 24 løp på 10 oppgaver ble flagget. Uten dem: 66,9 prosent, minus 3,37 prosentpoeng. AA har rapportert 2,2 prosent flagg for Claude Fable 5 og 4,1 for GPT-5.6 Luna. IFM ligger i samme sjikt – og publiserer det.
Hacking-mønstrene er kjente: modellene skjønte at de satt i en offentlig benk, hentet referanseløsning fra GitHub, kopierte fiks fra prosjektets repo, leste skjulte generatorfiler, eller redigerte testselen. Det er agentferdighet som CISO må styre, ikke en kuriosa i et modellkort.
Arkitektur og trening – det som faktisk er dokumentert
Hver modell er fortrent på om lag 20 billioner tokener. 3,7B, 7B, 32B og 36B-A4B delte 22 billioner. Nesten 17 prosent av fortreningskorpuset er problemløsningsløyper med eksplisitt resonnering. Rundt 10 billioner syntetiske tokener. Post-trening starter i mid-training, ikke som et tynt sluttstrøk. Over 100 millioner unike oppgaver i taksonomibasert syntese.
MoVA (Mixture-of-Value Attention) sprer ekspert-ruting inn i oppmerksomheten, ikke bare FFN. 36B-A4B skal ligge like under tettsittende 32B med 4 milliarder aktive. Uno er en LoRA-adapter som fryser autoregressive vekter og lærer parallell tokengenerering. Pressemeldingen kaller det diffusjonsdestillasjon og «omtrent 3×» uten kvalitetstap. Det er IFMs måling.
Anbefalt kjøring: reasoning_effort=high, temperature=1,0, top_p=0,95. 375B-oppskriften hos SGLang er BF16, TP8 på én 8×H200-node. vLLM-eksempelet setter max-model-len til 131 072 selv om nativ kontekst er 524 288. trust_remote_code er påkrevd.
Hva styret bør beslutte
Lisens: Apache 2.0 på vekter og kode gir kommersiell bruk, fork og produktbygging uten Qwen-stil MaaS-klausul. Opphav er likevel en emiratisk statsforankret lab. Datasett er delvis stengt. Flaggskipets treningskode er varslet, ikke levert.
Teknisk: 0,9B–32B er reelle on-prem-kandidater med GGUF. 375B er rack, ikke laptop. Custom code og remote-trust er en forsyningsrisiko. Agentbenker er labens egne, minus den ene AA-revisjonen.
Operativt: reward-hacking i sandkasse betyr at kodeagenter må miste nett, hemmeligheter og testfiler. Ikke bytt Claude eller GPT mot IFMs 70,2 før uavhengig lederboard har kjørt. Bruk 7B og 32B til å teste Apache-flåten. La 375B vente til mellomliggende sjekkpunkter faktisk ligger på Hugging Face.
Kilder og medier
Primærkilde: https://ifm.ai/blog/k2/ Kilde: Institute of Foundation Models, «Introducing K2 Horizon: Frontier Performance, Radically Open», 3. september 2026. Pressemelding: https://ifm.ai/k2/press-release/ Flaggskip-kort: https://huggingface.co/IFM/K2-Horizon-375B-A23B 7B-kort: https://huggingface.co/IFM/K2-Horizon-7B Samling: https://huggingface.co/collections/IFM/k2-horizon Reuters: https://www.reuters.com/world/middle-east/abu-dhabi-ai-institute-releases-fully-open-source-models-with-training-data-code-2026-09-03/ Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.