Needle 2 gjør tool-calling til en 14 MB edge-modell
Cactus Compute har sluppet Needle 2, en åpen 45 millioner-parameter modell laget for én smal, men viktig jobb: tool-calling, device control og strukturert uttrekk på svært små enheter. Det er ikke en ny chatmodell som prøver å konkurrere med frontier-labene på alt. Det er nettopp poenget.
Modellen pakkes som en 14 MB binærfil og skal kjøre en full sesjon i rundt 28 MB RAM. Cactus oppgir 500 token per sekund dekoding på Raspberry Pi 5, 400–1 500 token per sekund på VR-enheter som Meta Quest 3S og Apple Vision Pro, og 300–700 token per sekund på rimelige Android-telefoner. Ifølge selskapet kan minneprofilen også nå mikrocontroller-klassen, blant annet ESP32-P4 med ekstern RAM.
For ledere er den strategiske nyheten ikke at Needle 2 er «smartest». Det er at den flytter en del av agentarkitekturen bort fra skyen og inn i selve produktet. Når oppgaven er å velge riktig funksjon, fylle riktige argumenter og returnere strukturert JSON, trenger man ikke nødvendigvis en gigantisk generell modell. Man trenger en liten modell med hard kontrakt, lav latency, lavt strømforbruk og en trygg eskaleringsvei.
Cactus beskriver Needle 2 som en Simple Attention Network-modell, trent og kvantisert mot Cactus Quants fra starten av i stedet for å bli presset ned etterpå. Den bruker CQ2-bit, en 256-token sliding window, verktøydefinisjoner som holdes fast i konteksten, grammatikkstyrt dekoding og et confidence-signal som kan brukes til å avgjøre om en handling skal kjøres lokalt, spørres om på nytt eller sendes videre til en større modell.
Det gjør modellen interessant for tre typer beslutninger. Først edge-AI: wearables, smarthus, robotikk, industriutstyr og lavkosttelefoner der nettverk, batteri og personvern setter harde grenser. Deretter agentstyring: systemer der modellen ikke skal skrive lange svar, men velge mellom tillatte handlinger. Til slutt sikkerhet: jo nærmere modellen kommer fysisk styring av enhet, betaling, melding eller lås, desto viktigere blir det at output er begrenset av schema, confidence og policy.
Needle 2 er også en påminnelse om at «AI i produktet» ikke alltid betyr å putte GPT-klassen inn overalt. Mange operative agentflater er egentlig klassifisering, parameterfylling og beslutning om neste tool. Da er spørsmålet ikke bare hvilken modell som topper en generell benchmark, men hvilken modell som er liten nok, deterministisk nok og billig nok til å stå på hele tiden.
Cactus har publisert benchmarks mot blant annet Google Mobile Actions, DroidCall, Seal-Tools og BFCL v4 single-turn. Selskapet hevder at Needle 2 handler jevnt med langt større småmodeller som FunctionGemma 270M, LFM2.5 230M og Apple FM i flere tool-call-scenarioer, til tross for 5 til 70 ganger mindre størrelse. De tallene bør behandles som leverandørmålinger til uavhengige tester finnes bredere. Men retningen er tydelig: modellmarkedet splittes ikke bare mellom lukkede frontiermodeller og åpne store modeller. Det splittes også mellom generelle modeller og ekstremt smale modeller som kan gjøre én operasjon godt nok, lokalt.
For CIO-er og CISO-er er konsekvensen praktisk. Slike modeller kan redusere skyavhengighet, datalekkasjer og latency, men de flytter også mer ansvar ut i apper, enheter og firmware. Det krever andre kontroller enn en vanlig chatbotutrulling: signerte modellartefakter, versjonsstyrte tool-schemas, logging av tool-call-resultater, confidence-terskler, fallback til sky bare når policy tillater det, og tydelig skille mellom «foreslå handling» og «utfør handling».
Det siste punktet er spesielt viktig. En modell som kan kontrollere en enhet, skal ikke vurderes bare på om JSON-en er pen. Den må testes på feil navn, tvetydige kommandoer, manglende kontekst, språkblanding, ondsinnede input og uventede tool-lister. Hvis enheten kan åpne en dør, sende en melding eller trigge en industriell prosess, er feilklasse viktigere enn gjennomsnittsscore. Needle 2s confidence-gate og tomme kall ved off-topic input er derfor mer lederrelevant enn hastighetstallet alene.
Lisensen på modellen oppgis som Apache 2.0, og Cactus peker til GitHub, Hugging Face og en egen lanseringsside. Det gjør den lett å evaluere i en intern proof of concept. Men et seriøst pilotløp bør ikke starte med «kan vi kjøre den?». Det bør starte med «hvilke handlinger får en lokal modell lov til å velge, hvor går grensen for autonom utførelse, og når må en større modell eller et menneske inn?».
Den større trenden er klar: agentmarkedet får en ny bunn. Ikke bunn som i dårlig kvalitet, men bunn som i fysisk distribusjon. Modeller på titalls megabyte kan sitte i ringer, sensorer, kameraer, hjemmekontrollere og feltutstyr. Når de blir gode nok til tool-calling, får virksomheter et valg de ikke hadde før: kjøre flere små, lokale beslutninger nær kilden og reservere frontiermodellene til resonnering, koordinering og unntak.
Needle 2 er derfor ikke en «Claude- eller GPT-dreper». Det er mer interessant enn som så. Den viser hvordan AI-arkitekturen i virksomheter kan bli lagdelt: tiny models for umiddelbare lokale handlinger, mellomstore modeller for produktflyt, og frontiermodeller for komplekse vurderinger. Det er en mer realistisk vei til agentiske systemer i fysisk verden enn å sende hvert eneste lysbryter-, sensor- og mobilkommando-problem til en stor skyLLM.
Kilder og medier
Primærkilde: Cactus Compute – Needle 2: https://cactuscompute.com/needle
Supplerende verifikasjon: Hugging Face-modellkort for Cactus-Compute/needle2 og GitHub-repoet cactus-compute/needle.
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.