Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

OpenAI-agenter rammet RubyGems: over 2000 pakker – kalt godartet • Anthropic: Claude-bruddene var alignment-feil, ikke bare sandbox • Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face

PrismML Bonsai 2 27B: 5,9 GB Apache – stock llama.cpp gir tulletekst
PrismMLBonsaiQwenCIOCISOAI-modellerÅpne vekterLokal AIEnterprise AILeverandørstyring

PrismML Bonsai 2 27B: 5,9 GB Apache – stock llama.cpp gir tulletekst

JH
Joachim Høgby
17. september 202617. september 20264 min lesingKilde: PrismML

PrismML slipper 17. september Ternary Bonsai 2 27B. Det er ikke et nytt frontier-flaggskip. Det er Qwen3.8 27B med ternære vekter, Apache 2.0, og et fotavtrykk på 5,93 GB i PTQ1_0-GGUF. Laben, et Caltech-utspring med kapital fra Khosla Ventures, Cerberus, Google og Samsung, sier modellen beholder 98,2 prosent av basens aggregat over 20 egne benker. For CIO er poenget hybrid arkitektur: sensitivt arbeid lokalt, frontier i skyen. For CISO er poenget runtime-kjeden. Vektene er åpne. Kjøreren er det ikke, hvis dere forventer stock llama.cpp.

Hva som faktisk ligger på disk

Ternary Bonsai 2 27B har 27,36 milliarder parametere: 24,35B språk, 0,47B visjonstårn og 2,54B embedding og LM-hode. Arkitekturen er hybrid oppmerksomhet, omtrent 75 prosent lineær og 25 prosent full, med SwiGLU, RoPE og RMSNorm. Matrisevektene er {−1, 0, +1} i en fast rotert basis med FP16 gruppeskala. Effektiv bitbredde er 1,72 bpw som ekte ternær, 1,76 bpw som levert i PTQ1_0.

Kontekst er 262 144 tokens. Inn: tekst og bilde. Ut: tekst. Lisens: Apache 2.0. Repoet på Hugging Face er offentlig og ikke gated. Basen er merket Qwen/Qwen3.8-27B.

Artefaktene:

  • GGUF PTQ1_0: 5,93 GB
  • GGUF PQ2_0: 7,25 GB, enklere 2-bit, billigere å pakke ut, ofte raskere prompt
  • MLX 2-bit: 8,49 GB inkludert visjonstårn i full presisjon

Visjon krever egen mmproj: HQQ 4-bit på 0,63 GB eller BF16 på 0,93 GB. Uten den får dere ikke bilde inn. Demoen henter PQ2_0 som standard.

Tallene som skal bære 98 prosent

Alle hovedtall er PrismML sine, i tenkemodus. Ingen uavhengig lederbrett i lanseringen.

Agentisk og verktøy (τ²-bench, BFCLv3): 77,57 mot 79,74 for Qwen3.8 27B og 80,05 for Qwen3.6 27B. Koding (HumanEval+, LiveCodeBench v6, MBPP+, BigCodeBench): 81,58 mot 82,17 og 82,57. Instruksjon (IFBench, IFEval): 82,66 mot 81,25 og 74,53. Kunnskap og resonnering (MMLU-Redux, GPQA Diamond, AA-LCR): 83,95 mot 86,66 og 84,71. Matte (AIME 2026, AIME 2025, GSM8K, MATH-500): 96,57 mot 97,06 og 94,64. Syn (CharXiv, A-OKVQA, OmniDocBench v1.6, RealWorldQA, OCRBench v2): 78,59 mot 81,64 og 79,82. Samlet: 83,9 mot 85,4 og 83,6.

Instruksjonsfølging slår basen. Kunnskap, syn og agentisk verktøy taper noen poeng. Det er forventet i komprimering. Det er også akkurat der agentløkker straffer små feil over mange steg. Ta 98,2 prosent som labens aggregat, ikke som innkjøpsfasit mot Astra eller Fable 5.1.

Ytelse, også labens: inntil 143 tokens per sekund på GeForce RTX 5090, 46,8 på M5 Max. På RTX 4090 oppgis 0,714 mWh per token, 40 prosent mer energieffektivt enn en 8B-modell i full presisjon. Demoene er Cline-kodeagent og computer use på 5090. Det er arbeidsstasjon, ikke telefon. 1-bit Bonsai 27B på 3,9 GB er den PrismML tidligere har knyttet til iPhone.

Runtime er leverandørrisikoen

Dokumentasjonen er tydelig. Begge GGUF-pakkene krever PrismML sin llama.cpp-fork, prism-b10658 eller nyere. Den roterte vektbasisen trenger en Walsh–Hadamard-transform som ikke er oppstrøms ennå. På stock-bygg blir PTQ1_0 og PQ2_0 avvist. En Q2_0-fil kan laste stille og spytte tulletekst.

MLX-pakken kjører på stock MLX. Det er den praktiske veien på Mac uten fork. CUDA og Apple MLX er dekket via labens egne lavbit-kjerner. iPhone og iPad er nevnt for plattformen, ikke som dokumentert produksjonsmål for 5,9 GB-varianten.

Tenking er på som standard, arvet fra Qwen3.8 27B med innstillingene xhigh og medium. Budsjett styres per kall med thinking_budget_tokens. Verktøykall og bilde går gjennom vanlig OpenAI-kompatibelt API i demoen. Store bilder nedskaleres til omtrent 1 024 visjonstokens som standard på Metal, Vulkan og CPU. CUDA og ROCm går uten tak, med mindre dere setter et.

Hva det betyr for ledergruppen

Tre beslutninger.

Først: plassering. En 27B som får plass i 6–8 GB er et argument for lokal kodeassistent, intern dokumentanalyse og skjermbaserte agenter uten at møtereferat går til en amerikansk eller kinesisk API. Det erstatter ikke GPT-6 Astra eller Claude Fable 5.1. Det er et lag under, for data som ikke skal ut.

Deretter: leverandørkjede. Apache 2.0 på vektene løser lisens. Det løser ikke runtime. En fork av llama.cpp er ny angrepsflate, ny patch-rytme og ny kompetanse i plattformteamet. Si nei til «vi dumper GGUF i Ollama» som utrullingsplan. Test MLX på Mac, Prism-fork på NVIDIA, og mål hallusinasjon og verktøyfeil på egne oppgaver, ikke på labens 20-benk.

Til slutt: opphav. Basen er Qwen3.8 27B fra Alibaba. Lokal inferens fjerner databehandlerleddet. Den fjerner ikke treningsdata, eksportkontroll eller spørsmålet om kinesisk modell i regulert virksomhet. EØS-suverenitet er ikke det samme som fil på disk. Be om SBOM for fork og kjerner, og hold sky-eskalering bak policy.

Kilder og medier

Primærkilde: PrismML, «Introducing Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint», 17. september 2026: https://prismml.com/news/bonsai-2-27b

Bekreftet i PrismML-dokumentasjon for Ternary Bonsai 2 27B og Hugging Face-repoet prism-ml/Ternary-Bonsai-2-27B-gguf (Apache 2.0, sist endret 17. september 2026).

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.