Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face • Bloomberg: NVIDIA-kunder varsles om over 15 prosent prishopp på AI-servere • OpenAI kutter GPT-5.6 Sol mer enn 20 prosent – i tre måneder

Liquid AI flytter visuelle agenter ned på enheten
Breaking
AI-modellerMultimodal AIEdge AIAgenterCIO

Liquid AI flytter visuelle agenter ned på enheten

JH
Joachim Høgby
13. august 202613. august 20264 min lesingKilde: Liquid AI

Liquid AI slipper LFM2.5-VL-3B, en åpen vision-language-modell på rundt 3,1 milliarder parametere som er bygget for å lese skjermer, dokumenter og bilder raskt nok til å brukes lokalt. Dette er ikke en ny stor frontier-modell som skal vinne alt i skyen. Det er mer interessant enn som så: en praktisk modell for selskaper som vil flytte visuell forståelse nærmere bruker, enhet og prosess.

Modellen bygger på LFM2.5-2.6B som språkrygg, kombinert med en SigLIP2 400M NaFlex vision encoder. Liquid beskriver den som en ikke-resonnerende modell: den svarer direkte i stedet for å bruke lange skjulte tankespor. Det gjør den mindre egnet som generell problemløser, men bedre til oppgaver der ventetid, kostnad og lokal kjøring betyr mer enn maksimal refleksjon. For mange bedriftscase er det akkurat riktig kompromiss.

Det viktigste i lanseringen er hva modellen er trent og målt for. Liquid peker på fire løft fra forrige LFM2-VL-3B: skjermforståelse, verktøykall, grounding og multi-image input. ScreenSpot-v2-snittet oppgis til 80,7, langt over Gemma-4-E4B i Liquids tabell og tett på større modeller. RefCOCO precision@1 går fra 57,1 til 87,9. ToolSandbox mer enn dobles fra 26,4 til 59,5, mens BFCL v4 øker fra 20,5 til 32,5. Dette er ikke bare hyggelige benchmarktall. Det peker mot modeller som kan se en skjerm, finne riktig kontroll, trekke ut dokumentdata og kalle et verktøy uten at alt må sendes til en tung skyagent.

For CIO-er er dette kanten av agentstakken. De fleste AI-agenter i bedrifter sliter ikke bare med språk. De sliter med grensesnitt. De må lese en PDF, forstå et skjermbilde, hente ut tabeller, peke på et felt, sjekke en faktura, identifisere et objekt i et bilde eller forklare hva som skjer i et dashboard. Når slike oppgaver går via store multimodale skymodeller hver gang, får du tre problemer: latency, datadeling og kostnad per hendelse. En liten VLM som kan kjøres på laptop, edge-boks, mobil eller privat GPU endrer arkitekturen. Ikke fordi den erstatter frontier-modellen, men fordi den kan sile, merke, parse og handle før frontier-modellen eventuelt kobles inn.

Liquid hevder også at modellen er rask fra dag én. Den skal dekode 228 tokens per sekund på Apple M5 Max, 116 tokens per sekund på AMD Ryzen AI Max+ 395 og 20 tokens per sekund på Galaxy S26 Ultra, med rundt 3 GB minnebruk. På en H100 rapporterer Liquid cirka 11.000 output-tokens per sekund ved høy samtidighet. Tallene er leverandørens egne og bør testes i egen lastprofil før de blir innkjøpsgrunnlag. Likevel er retningen tydelig: vision-modeller blir små og billige nok til å være infrastruktur, ikke bare demo.

Det er også et sikkerhetspoeng her. Dokumentforståelse, OCR, skjermlesing og lokal bildeanalyse treffer ofte data som virksomheter helst ikke vil sende ut: kundedokumenter, interne skjermbilder, helseopplysninger, produksjonsfeil, kontrakter og sikkerhetsvarsler. En lokal modell med god nok ytelse kan brukes som førsteledd i en mer kontrollert pipeline. Den kan trekke ut struktur, maskere felt, gjøre grovklassifisering eller varsle om usikkerhet før sensitive data eventuelt eskaleres til en større modell. Det er ikke automatisk compliance. Men det er en bedre teknisk posisjon enn «alt til API først, spør juristen etterpå».

For CISO er den andre siden like viktig: små lokale modeller må fortsatt styres. Hvis en VLM kan lese skjermen og kalle verktøy, er den ikke bare et analysebibliotek. Den blir en del av handlingsflaten. Den trenger policy rundt hvilke bilder den får se, hvilke verktøy den får bruke, hva som logges, og hvordan feilaktig grounding håndteres. En modell som peker på feil knapp i et økonomisystem kan være like dyr som en tekstmodell som finner på en policy. Lokale agenter reduserer ikke behovet for kontroll. De flytter kontrollpunktet nærmere klienten.

Den operative anbefalingen er enkel: ikke vurder LFM2.5-VL-3B som «enda en modell». Vurder den som en komponent i dokument- og skjermlaget. Test den på tre konkrete oppgaver: OCR/layout på egne dokumenter, skjermforståelse i ett internt websystem, og grounding på reelle bilder eller UI-objekter. Mål latency, feilrater, minnebruk og hvor ofte en større modell må kobles inn. Hvis tallene holder, kan gevinsten være betydelig: billigere multimodal preprosessering, mer privat databehandling og raskere agentflyt.

Det strategiske bildet er at AI-stakken blir mer lagdelt. Frontier-modeller tar komplekse beslutninger og vanskelige resonnementer. Mindre modeller håndterer sanntid, grensesnitt, strukturering og lokal kontekst. Liquid AI angriper akkurat det rommet. For ledere betyr det at modellvalg ikke lenger bare er en rangering på én leaderboard. Det handler om hvor i prosessen modellen skal stå. LFM2.5-VL-3B er interessant fordi den passer nær handlingen, der skjermen, dokumentet og brukeren faktisk er.

Kilder og medier

Primærkilde: Liquid AI – https://www.liquid.ai/blog/lfm2-5-vl-3b

Modellkort: LiquidAI/LFM2.5-VL-3B på Hugging Face.

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.