Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Microsoft lanserer cybermodell som kutter agentkost • NVIDIA og Microsoft åpner AI-sikkerhetsallianse • WSJ: Nvidia forhandler 250 milliarder dollar i garantier for OpenAI-datasenter • OpenAI lover teknisk rapport etter Hugging Face-hendelse • Anthropic gjør Claude Opus 5 til ny toppmodell for agentarbeid

Moonshot viser hvor svake AI-modeller fortsatt er på syn
AI-modellerBenchmarksMultimodal AIAI-agenterRisikostyring

Moonshot viser hvor svake AI-modeller fortsatt er på syn

JH
Joachim Høgby
27. juli 202627. juli 20264 min lesingKilde: Moonshot AI / Kimi

Moonshot AI har sluppet PerceptionBench, en ny benchmark som går rett på et svakt punkt i multimodale AI-modeller: de ser fortsatt ikke godt nok. Ikke i betydningen at de mangler fancy demoer, men i den mer krevende betydningen: kan modellen tolke et bilde presist, svare kort og riktig, og unngå å blande inn resonnering, gjetting eller verdenskunskap?

Det er en viktig nyhet fordi mye av neste bølge i AI handler om modeller som skal handle i visuelle miljøer. De skal lese skjermbilder, forstå dokumenter, navigere nettlesere, kontrollere desktop-apper, tolke kamera eller robotdata og fatte beslutninger basert på det de ser. Hvis grunnlaget er feil, blir agenten feil. En autonom arbeidsflyt som misleser et ikon, en rad i et regneark eller en forskjell i et skjermbilde, kan gi helt andre konsekvenser enn en chatbot som bare svarer litt ullent.

PerceptionBench er bygget for å skille ren persepsjon fra høyere resonnering. Moonshot skriver at teamet har analysert feilmønstre hos frontier-modeller på tvers av 42 eksisterende benchmarks. Ut fra disse feilene har de definert ti atomiske visuelle evner og laget 3 000 verifiserte spørsmål. Hvert spørsmål skal isolere én evne og kunne besvares ved å se på bildet, uten ekstern kunnskap og uten kompleks logikk.

Poenget er skarpt: Dagens brede VLM-tester kan skjule hva modellen faktisk feiler på. En modell kan bomme fordi den ikke ser objektet, fordi den ikke teller riktig, fordi den misforstår romlig relasjon, eller fordi den resonnerer seg bort fra det som faktisk er i bildet. Hvis alt blandes i én totalscore, blir det vanskelig å vite om modellen er trygg nok til agentarbeid.

Tallene som bør stoppe litt opp

I Moonshots publiserte leaderboard evalueres 16 frontier-modeller med felles promptoppsett og høyeste tilgjengelige reasoning-budget. Resultatet er ikke akkurat en seiersrunde for bransjen. Ingen modell når 60 prosent accuracy. GPT-5.6 Sol topper tabellen med 59,7 prosent. Kimi K3 følger med 58,5 prosent. Claude Fable 5 ligger på 57,2 prosent, Gemini 3.1 Pro på 56,2 prosent og GPT-5.5 på 55,8 prosent.

Det betyr ikke at modellene er ubrukelige. Det betyr at benchmarken er laget for å finne en veldig spesifikk svakhet: atomisk syn. Og akkurat der er rommet mellom imponerende demo og driftsklar presisjon fortsatt stort.

Moonshot trekker særlig frem at persepsjonsrelatert hallusinasjon er svakeste evne i snitt. Det er den delen ledere bør merke seg. Når en tekstmodell hallusinerer, kan en ansatt ofte oppdage det med fagkunnskap eller kildekontroll. Når en visuell agent hallusinerer over et skjermbilde, kan feilen se ut som en helt vanlig handling: feil knapp, feil felt, feil kunde, feil dokumentversjon.

Hvorfor dette betyr noe for CIO og CISO

For virksomheter som tester AI-agenter, er PerceptionBench en påminnelse om at multimodalitet ikke er en binær egenskap. Det holder ikke at modellen kan motta bilder. Spørsmålet er om den kan se presist nok til at handlinger kan automatiseres.

Dette berører spesielt fire områder.

Først: computer-use-agenter. Hvis en modell skal styre nettleser eller apper, må den lese UI riktig. Små visuelle feil kan bli store prosessfeil.

Andre: dokumentflyt. Fakturaer, kontrakter, skjermbilder og vedlegg inneholder ofte detaljer som må tolkes visuelt, ikke bare OCR-leses. En modell som ser feil struktur eller feil relasjon mellom tall og etiketter, kan produsere plausible, men gale beslutningsgrunnlag.

Tredje: sikkerhet. CISO-team som vurderer AI til SOC-arbeid, phishing-triage eller hendelsesanalyse bør skille mellom språkforståelse og faktisk visuell evidens. Modellen kan skrive en god analyse selv om den har sett feil artefakt.

Fjerde: governance. Benchmarken gir et mer presist språk for innkjøp og risikostyring. Ikke spør bare om en leverandør støtter vision. Be om testresultater på telling, lokalisering, attributter, romlige relasjoner, OCR og visuell hallusinasjon, helst på egne data.

En mer nyttig test enn nok en SOTA-plakat

Det mest interessante med PerceptionBench er ikke at én modell slår en annen med et par prosentpoeng. Det interessante er metoden. Benchmarken er konstruert nedenfra, fra faktiske feiltyper. Den prøver å isolere tidligste feilpunkt før modellen får anledning til å pynte på svaret med resonnering.

Det gjør den mer relevant for operasjonell AI enn mange brede demotester. I produksjon er det sjelden nok at en modell er smart i snitt. Den må være pålitelig i de kjedelige, små, konkrete oppgavene. Telle riktig. Se riktig objekt. Skille to nesten like elementer. Plassere noe korrekt i et bilde. Ikke finne opp en detalj fordi svaret ellers blir mer elegant.

For hogby.ai-lesere er konklusjonen enkel: Bruk multimodale modeller, men ikke behandle syn som løst. Legg inn menneskelig kontroll der modellen skal handle på visuell input. Test på egne skjermbilder og egne dokumenter. Og bygg agentflyter slik at modellen må vise hva den har sett før den får lov til å gjøre noe som endrer data, sender meldinger eller påvirker kunder.

Moonshot har samtidig gjort datasettsiden tilgjengelig på Hugging Face og koden på GitHub. Det gir utviklere en praktisk vei inn i egne evalueringer, men lisens og kommersiell bruk må vurderes separat. Hugging Face-siden oppgir CC-BY-NC-4.0 for datasettet.

Dette er ikke den mest glorete AI-nyheten i dag. Det er en av de mer nyttige. Den minner oss om at AI-agenter ikke bare trenger bedre hjerner. De trenger bedre øyne.

Kilder og medier

Primærkilde: Moonshot AI / Kimi, https://www.kimi.com/blog/perception-bench

Offisiell annonsering på X: https://x.com/Kimi_Moonshot/status/2081813202514681878

Dataset: https://huggingface.co/datasets/moonshotai/PerceptionBench

Kode: https://github.com/MoonshotAI/PerceptionBench

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.