Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

OpenAI lover teknisk rapport etter Hugging Face-hendelse • Anthropic gjør Claude Opus 5 til ny toppmodell for agentarbeid • Falske AI-plugins stjal utviklernes API-nøkler • AI-agentpakker på npm ble kapret i 27 minutter • Beijing tvinger Meta til å reversere Manus-kjøp

Inkling viser hvor tøft agentarbeid fortsatt er
AI-modellerAI-agenterOpen weightsBenchmarksCIO

Inkling viser hvor tøft agentarbeid fortsatt er

JH
Joachim Høgby
22. juli 202622. juli 20264 min lesingKilde: Artificial Analysis

Artificial Analysis har testet Thinking Machines Labs Inkling på AA-Briefcase, en benchmark laget for det ledergrupper faktisk bryr seg om: lange, rotete arbeidsløp der en modell må lese mange filer, holde tråden og levere noe som kan brukes i en virksomhet.

Det korte bildet: Inkling er interessant fordi den er en åpen vekter-modell fra en amerikansk lab. Den er ikke bare enda en chatmodell. Men testen viser også hvorfor AI-agentstrategi fortsatt må behandles som produktutvikling, ikke som innkjøp av magi.

Hva som er nytt

Inkling scorer 836 Elo på AA-Briefcase, ifølge Artificial Analysis. Det plasserer modellen foran DeepSeek V4 Flash, men bak ledende åpne modeller som Nemotron 3 Ultra og GLM-5.2. Det er en nyttig posisjon: god nok til å være relevant i vurderinger av åpne modeller, men ikke god nok til at ledere bør anta at open weights automatisk betyr agentklar.

AA-Briefcase er særlig interessant fordi den ikke bare måler svar i en tekstboks. Testen simulerer kunnskapsarbeid med tusenvis av inputfiler og leveranser som regneark, presentasjoner, dokumenter, PDF-er og UI-utkast. Scoren kombinerer tre ting: binære sjekker mot fasit, vurdering av analytisk kvalitet og vurdering av presentasjonskvalitet. Det er nærmere en intern stabstest enn en klassisk modell-leaderboard.

For Inkling er fasitdelen svakest. Modellen får 19,3 prosent på rubric-scoren. Det er under MiMo-V2.5-Pro på 21,4 prosent, men over DeepSeek V4 Flash max på 18,7 prosent og Gemini 3.5 Flash-Lite på 14,8 prosent. Artificial Analysis peker også på at Inkling sliter mest med oppgaver som inneholder andre filtyper enn Excel, PowerPoint, PDF og Word, selv om modellen har multimodal støtte.

Hvorfor det betyr noe

For CIO-er og CISO-er er poenget ikke at Inkling er dårlig. Poenget er at realistisk agentarbeid avdekker feil som ikke synes i vanlige demoer. En modell kan skrive pent, følge en dialog og imponere i korte oppgaver, men fortsatt bomme når den må styre en lang arbeidsflyt med mange filer og flere leveranseformater.

Det ser vi i delscorene. Inkling gjør det bedre på presentasjon enn på analyse: 863 Elo for presentasjonskvalitet mot 764 for analytisk kvalitet. Det er et klassisk enterprise-risiko-signal. Resultatet kan se ryddig ut før innholdet er solid nok. I praksis betyr det at styring, verifikasjon og faglig review fortsatt må bygges inn i arbeidsflyten, spesielt der output blir beslutningsgrunnlag.

Tokenbruken er også verdt å merke seg. Artificial Analysis oppgir at Inkling bruker rundt 52.000 output-tokens per AA-Briefcase-oppgave, og rundt 5 millioner output-tokens for hele testpakken. Det gjør kost, ventetid og sporbarhet til mer enn tekniske detaljer. Når en agent bruker mange runder og mye output for å komme frem til et middelmådig resultat, må virksomheten regne på kost per godkjent leveranse, ikke bare pris per million tokens.

Inkling har dessuten et høyt antall turer per oppgave: gjennomsnitt 81, median 49. Samtidig bruker den relativt få verktøykall per tur, rundt 0,5. Det kan tyde på en agent som jobber lenge, men ikke nødvendigvis effektivt nok med verktøyene sine. For selskaper som bygger interne agenter er dette et viktig mønster: orkestrering, verktøydesign og evalueringsregime kan være like avgjørende som selve modellen.

Lederkonklusjonen

Dette er et nyktert datapunkt for open weights i virksomheter. Inkling bør ikke avskrives. Åpne modeller gir kontroll, fleksibilitet og potensielt lavere leverandørrisiko. Men AA-Briefcase-resultatet minner om at kontroll over vektene ikke automatisk gir kontroll over arbeidskvaliteten.

Den praktiske anbefalingen er enkel: test modeller på egne arbeidsløp før de får operativ rolle. Ikke bare spør om modellen kan lese PDF-er eller lage presentasjoner. Be den produsere en faktisk leveranse fra ufullstendige kilder, med krav til tall, format, begrunnelse og sporbarhet. Mål deretter feilrate, review-tid, tokenbruk, ventetid og hvor ofte mennesker må rydde opp.

Hvis open weights skal inn i kritiske prosesser, bør de først vinne på kontrollerte, virksomhetsnære evaluer. Inkling viser at feltet går raskt fremover. Den viser også at den siste meteren, fra imponerende modell til pålitelig kunnskapsarbeider, fortsatt er den dyreste.

Kilder og medier

Primærkilde: Artificial Analysis - https://artificialanalysis.ai/articles/how-thinking-machines-lab-s-inkling-performs-on-agentic-knowledge-work

Benchmark-kontekst: https://artificialanalysis.ai/evaluations/aa-briefcase

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.