Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face • Bloomberg: NVIDIA-kunder varsles om over 15 prosent prishopp på AI-servere • OpenAI kutter GPT-5.6 Sol mer enn 20 prosent – i tre måneder

AA: Telefon-AI rangeres på 16K og ventetid, ikke milliarder parametre
AI-modellerArtificial AnalysisOn-deviceEdge AICIOCISO

AA: Telefon-AI rangeres på 16K og ventetid, ikke milliarder parametre

JH
Joachim Høgby
24. august 202624. august 20266 min lesingKilde: Artificial Analysis

Frontier-tabellen forteller ikke om en modell kan svare i lomma uten å tømme batteriet eller gjette. Artificial Analysis har 24. august sluppet et eget mål for modeller som faktisk får plass på mobil: samme 4-bit-bygg (eller lavere) som telefonen laster, under 8 GB med KV-cache ved 8K, intelligence kjørt av AA og inferens målt på ekte telefoner.

Det er en eval, ikke en modelllansering. For CIO og CISO er det likevel innkjøpsstoff. On-device betyr at prompt og kontekst kan bli på enheten. Da er minne, termikk og ventetid like mye styringssak som poengsum.

Hva som faktisk måles

AA bruker fem tester valgt for telefonklassen, ikke for frontier-agenter: BFCL (verktøykall, 640 oppgaver), IFBench (instruksjonsfølging), AA-Omniscience (kunnskap og hallusinasjonsmotstand), GPQA Diamond og MATH-500. Store agent-evaler som GDPval-AA og Terminal-Bench legger små modeller i gulvet. Her skal scoren skille 230M fra 9B.

Inferensdelen er utviklet og kjørt av Liquid AI med det åpne verktøyet Pipette, i klimakontrollert lab. AA skriver at de har validert metoden uavhengig. Byggene serveres med llama.cpp. 41 kvantiserte bygg er scoret. 33 av dem kjørte på iPhone 17 Pro. Galaxy S26 Ultra er med i programmet. Live-tallene skal oppdateres etter hvert som modeller og enheter kommer til.

Samarbeidet er en interessekonflikt som må leses inn i tabellen. Liquid AI sine LFM2.5-modeller ligger på Pareto-fronten. Intelligence-tallene er AAs. Hastighet og minne er målt med Liquid-harnessen AA sier de har sjekket.

16K-vinduet, ikke parameterantallet, setter rekkefølgen

På iPhone 17 Pro, med 16K som primær cap, deler Nanbeige4.2-3B og LFM2.5-2.6B toppen med 63. Deretter Ornith-1.0-9B på 62 og Qwen3.5 9B (Reasoning) på 61. Det er der likheten slutter.

LFM2.5-2.6B svarer på en standard 1 024-tokens prompt med 256 tokens ut på 8,0 sekunder og 2,3 GB. Nanbeige bruker 21,4 sekunder og 4,0 GB. De to 9B-modellene trenger mer enn 25 sekunder og 6,9 GB. På en 12 GB-telefon er det lite igjen til OS og andre apper.

Pareto-fronten er kort. Seks modeller er uslått på både score og tid: LFM2.5-230M (27 på 0,9 s), MiniCPM5-1B (45 på 2,9 s), LFM2.5-8B-A1B (58 på 5,7 s), Ling 3.0 Tiny (59 på 5,7 s), LFM2.5-2.6B (63 på 8,0 s) og Nanbeige4.2-3B (63 på 21,4 s). De to MoE-modellene aktiverer rundt én milliard parametre per token. Derfor kan 8B-vekter svare under seks sekunder.

Hev capen til 64K, og Ling 3.0 Tiny går først med 66. AA slår fast at et 64K-vindu ikke får plass i telefonminnet. Med 55 ut-tokens i sekundet kan 64K ut bety mer enn tjue minutter og merkbar batteribruk. Derfor er 16K primærlederen.

Ett minutt snur tabellen helt. Cap på det en modell rekker å generere på 60 sekunder på iPhone 17 Pro gir LFM2.5-8B-A1B 47, LFM2-2.6B-Exp 45 og Gemma 4 E4B (ikke-resonnerende) 44. LFM2.5-2.6B faller til 38. Nanbeige lander på 18: 14 tokens i sekundet gir omtrent 850 tokens, så resonneringen blir ikke ferdig. Qwen3.5 9B (Reasoning) scorer 14. AA bruker ikke ettminuttsgrensen som primærfilter, men skriver at den kan ligge nærmere det en mobilbruker tåler å vente.

Verbøsitet og gjetting er driftsrisiko

Qwen3.5 9B er intelligent, men dyr i tokens. Ett gjennomløp av settet bruker 74,5 millioner ut-tokens, mot 5,2 millioner for Gemma 4 E4B (Reasoning), som ligger innen to poeng totalt. Resonneringsvarianten treffer 16K-grensen i 29 prosent av genereringene. Det senker scoren. På telefonen er det også varme, tid og batteri.

Styrkene peker hver sin vei. Nanbeige er mest balansert: nær toppen på BFCL (76 prosent), tredje på MATH-500 (96) og sjette på GPQA Diamond (67). Qwen3.5 9B uten resonnering er sterkest på verktøykall (77 prosent BFCL) og vitenskap (79 prosent GPQA). Ornith-1.0-9B husker flest fakta (15 prosent treff på AA-Omniscience). LFM2.5-2.6B følger instrukser best på iPhone (59 prosent IFBench), tar over 90 prosent på MATH-500, og er klart mer villig til å avvise enn å gjette: 79 prosent ikke-hallusinasjon mot 33 prosent for Nanbeige og 24 og 1 prosent for de to Qwen3.5 9B-variantene. Uten den komponenten ville Nanbeige, Ornith og Qwen-resonnering ligget over.

For CISO er det tallet som betyr noe i en on-device agent som slår opp konto, booker eller svarer ansatte. En modell som scorer høyt fordi den gjetter, er en datalekkasje i ny innpakning: feil svar, med selvtillit, uten sky.

End-to-end tid spenner faktor 30, fra 0,9 sekunder for LFM2.5-230M til 26,7 for Falcon-H1R-7B på identisk 1 024/256-prompt. Toppminne ved 4K går fra 0,4 GB til 6,9 GB.

Hva ledelsen bør gjøre med tallet

Ikke les 9B som «bedre telefonmodell». Les kvantisering, vindu, tokens per svar og om modellen avviser når den ikke vet. Hvis svaret må komme på under ett minutt, er det en annen vinner enn 16K-snittet. Hvis data ikke skal forlate enheten, er 2,3 GB og lav hallusinasjon mer relevant enn et frontier-index.

Kjøp og arkitektur må også prise inn at runtime på mobil er umoden. AA peker på chat-maler som ikke renderer verktøykall, parsere som dropper parallelle kall, og flagg som stille kutter kontekst. Ett modellnavn dekker mange bygg. Resultatene gjelder llama.cpp, 4-bit eller lavere, og de to telefonene i testen. Annen NPU-stack kan flytte både tid og minne.

AA planlegger å sammenligne på minnefotavtrykk i stedet for én kvantisering, legge til flere rammeverk enn llama.cpp, og lage evaler som er bygd for små modeller. Inntil da er 16K-tabellen og ettminutts-tabellen to ulike innkjøpslister. Bland dem, og du kjøper en modell som ser smart ut i lab og timeout-er i lomma.

Kilder og medier

Primærkilde: Artificial Analysis, «Intelligence at pocket scale: Benchmarking small models and mobile phones», 24. august 2026: https://artificialanalysis.ai/articles/mobile-phone-intelligence-inference

Live-resultater og enheter: https://artificialanalysis.ai/hardware-inference-stack/mobile-phones

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.