PrismML Bonsai 2 27B: 5,9 GB Apache – stock llama.cpp gir tulletekst
PrismML slipper 17. september Ternary Bonsai 2 27B. Det er ikke et nytt frontier-flaggskip. Det er Qwen3.8 27B med ternære vekter, Apache 2.0, og et fotavtrykk på 5,93 GB i PTQ1_0-GGUF. Laben, et Caltech-utspring med kapital fra Khosla Ventures, Cerberus, Google og Samsung, sier modellen beholder 98,2 prosent av basens aggregat over 20 egne benker. For CIO er poenget hybrid arkitektur: sensitivt arbeid lokalt, frontier i skyen. For CISO er poenget runtime-kjeden. Vektene er åpne. Kjøreren er det ikke, hvis dere forventer stock llama.cpp.
Hva som faktisk ligger på disk
Ternary Bonsai 2 27B har 27,36 milliarder parametere: 24,35B språk, 0,47B visjonstårn og 2,54B embedding og LM-hode. Arkitekturen er hybrid oppmerksomhet, omtrent 75 prosent lineær og 25 prosent full, med SwiGLU, RoPE og RMSNorm. Matrisevektene er {−1, 0, +1} i en fast rotert basis med FP16 gruppeskala. Effektiv bitbredde er 1,72 bpw som ekte ternær, 1,76 bpw som levert i PTQ1_0.
Kontekst er 262 144 tokens. Inn: tekst og bilde. Ut: tekst. Lisens: Apache 2.0. Repoet på Hugging Face er offentlig og ikke gated. Basen er merket Qwen/Qwen3.8-27B.
Artefaktene:
- GGUF PTQ1_0: 5,93 GB
- GGUF PQ2_0: 7,25 GB, enklere 2-bit, billigere å pakke ut, ofte raskere prompt
- MLX 2-bit: 8,49 GB inkludert visjonstårn i full presisjon
Visjon krever egen mmproj: HQQ 4-bit på 0,63 GB eller BF16 på 0,93 GB. Uten den får dere ikke bilde inn. Demoen henter PQ2_0 som standard.
Tallene som skal bære 98 prosent
Alle hovedtall er PrismML sine, i tenkemodus. Ingen uavhengig lederbrett i lanseringen.
Agentisk og verktøy (τ²-bench, BFCLv3): 77,57 mot 79,74 for Qwen3.8 27B og 80,05 for Qwen3.6 27B. Koding (HumanEval+, LiveCodeBench v6, MBPP+, BigCodeBench): 81,58 mot 82,17 og 82,57. Instruksjon (IFBench, IFEval): 82,66 mot 81,25 og 74,53. Kunnskap og resonnering (MMLU-Redux, GPQA Diamond, AA-LCR): 83,95 mot 86,66 og 84,71. Matte (AIME 2026, AIME 2025, GSM8K, MATH-500): 96,57 mot 97,06 og 94,64. Syn (CharXiv, A-OKVQA, OmniDocBench v1.6, RealWorldQA, OCRBench v2): 78,59 mot 81,64 og 79,82. Samlet: 83,9 mot 85,4 og 83,6.
Instruksjonsfølging slår basen. Kunnskap, syn og agentisk verktøy taper noen poeng. Det er forventet i komprimering. Det er også akkurat der agentløkker straffer små feil over mange steg. Ta 98,2 prosent som labens aggregat, ikke som innkjøpsfasit mot Astra eller Fable 5.1.
Ytelse, også labens: inntil 143 tokens per sekund på GeForce RTX 5090, 46,8 på M5 Max. På RTX 4090 oppgis 0,714 mWh per token, 40 prosent mer energieffektivt enn en 8B-modell i full presisjon. Demoene er Cline-kodeagent og computer use på 5090. Det er arbeidsstasjon, ikke telefon. 1-bit Bonsai 27B på 3,9 GB er den PrismML tidligere har knyttet til iPhone.
Runtime er leverandørrisikoen
Dokumentasjonen er tydelig. Begge GGUF-pakkene krever PrismML sin llama.cpp-fork, prism-b10658 eller nyere. Den roterte vektbasisen trenger en Walsh–Hadamard-transform som ikke er oppstrøms ennå. På stock-bygg blir PTQ1_0 og PQ2_0 avvist. En Q2_0-fil kan laste stille og spytte tulletekst.
MLX-pakken kjører på stock MLX. Det er den praktiske veien på Mac uten fork. CUDA og Apple MLX er dekket via labens egne lavbit-kjerner. iPhone og iPad er nevnt for plattformen, ikke som dokumentert produksjonsmål for 5,9 GB-varianten.
Tenking er på som standard, arvet fra Qwen3.8 27B med innstillingene xhigh og medium. Budsjett styres per kall med thinking_budget_tokens. Verktøykall og bilde går gjennom vanlig OpenAI-kompatibelt API i demoen. Store bilder nedskaleres til omtrent 1 024 visjonstokens som standard på Metal, Vulkan og CPU. CUDA og ROCm går uten tak, med mindre dere setter et.
Hva det betyr for ledergruppen
Tre beslutninger.
Først: plassering. En 27B som får plass i 6–8 GB er et argument for lokal kodeassistent, intern dokumentanalyse og skjermbaserte agenter uten at møtereferat går til en amerikansk eller kinesisk API. Det erstatter ikke GPT-6 Astra eller Claude Fable 5.1. Det er et lag under, for data som ikke skal ut.
Deretter: leverandørkjede. Apache 2.0 på vektene løser lisens. Det løser ikke runtime. En fork av llama.cpp er ny angrepsflate, ny patch-rytme og ny kompetanse i plattformteamet. Si nei til «vi dumper GGUF i Ollama» som utrullingsplan. Test MLX på Mac, Prism-fork på NVIDIA, og mål hallusinasjon og verktøyfeil på egne oppgaver, ikke på labens 20-benk.
Til slutt: opphav. Basen er Qwen3.8 27B fra Alibaba. Lokal inferens fjerner databehandlerleddet. Den fjerner ikke treningsdata, eksportkontroll eller spørsmålet om kinesisk modell i regulert virksomhet. EØS-suverenitet er ikke det samme som fil på disk. Be om SBOM for fork og kjerner, og hold sky-eskalering bak policy.
Kilder og medier
Primærkilde: PrismML, «Introducing Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint», 17. september 2026: https://prismml.com/news/bonsai-2-27b
Bekreftet i PrismML-dokumentasjon for Ternary Bonsai 2 27B og Hugging Face-repoet prism-ml/Ternary-Bonsai-2-27B-gguf (Apache 2.0, sist endret 17. september 2026).
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.