Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

OpenAI lover teknisk rapport etter Hugging Face-hendelse • Anthropic gjør Claude Opus 5 til ny toppmodell for agentarbeid • Falske AI-plugins stjal utviklernes API-nøkler • AI-agentpakker på npm ble kapret i 27 minutter • Beijing tvinger Meta til å reversere Manus-kjøp

Artificial Analysis måler AI-agenter på ekte kunnskapsarbeid
AI-modellerAI-agenterBenchmarksCIOCISOKunnskapsarbeid

Artificial Analysis måler AI-agenter på ekte kunnskapsarbeid

JH
Joachim Høgby
22. juli 202622. juli 20264 min lesingKilde: Artificial Analysis

Artificial Analysis har lansert AA-Briefcase, en ny agentisk benchmark som måler modeller på noe langt nærmere faktisk kontorarbeid enn klassiske spørsmål-og-svar-tester. Det er en viktig dreining: Hvis AI-agenter skal brukes i økonomi, produkt, strategi, analyse og utviklingsnære arbeidsflyter, holder det ikke å vite hvilken modell som scorer høyt på isolerte resonneringsoppgaver. Man må vite hvilken modell som kan ta mange filer, bygge en leveranse, holde struktur over tid og produsere noe en leder faktisk kan bruke.

AA-Briefcase er konstruert rundt fire større kunnskapsarbeidsprosjekter med tusenvis av inputfiler og 91 oppgaver. Oppgavene dekker realistiske arbeidsflyter innen blant annet data science, produktledelse og selskapsstrategi. Modellene må produsere konkrete leveranser, ikke bare tekstlige svar: regneark, presentasjoner, dokumenter, UI-skisser og andre strukturerte outputs. Hver oppgave vurderes mot en rubric, og resultatene samles i en AA-Briefcase Elo som kombinerer pass-rate på faktiske sjekker, analytisk kvalitet og presentasjonskvalitet.

Dette er interessant fordi benchmarken treffer akkurat den delen av AI-markedet som nå er vanskeligst å kjøpe inn fornuftig: agentisk kunnskapsarbeid. En modell kan være sterk på kode eller generell resonnering, men likevel falle ned når den må sortere mange filer, holde orden på krav, formatere en PowerPoint, levere et regneark med riktig logikk og samtidig forklare analysen på en ryddig måte. For CIO-er og CISO-er er det ofte her gevinsten, risikoen og kostnaden faktisk oppstår.

De første tallene viser også at forskjellene mellom modellene ikke bare handler om rå intelligens. På Artificial Analysis-siden ligger Claude Fable 5 med fallback øverst med rundt 1574 i AA-Briefcase Elo, tett fulgt av Kimi K3 med rundt 1541 og GPT-5.6 Sol max med rundt 1505. Claude Sonnet 5 max, Claude Opus 4.8 max og Grok 4.5 high følger lenger ned. Samtidig viser målingen at flere åpne eller mer spesialiserte modeller kan være nyttige i bestemte deler av arbeidsflyten, men at avstanden til de beste systemene fortsatt er tydelig når leveransen skal være både korrekt, analytisk god og presentabel.

Et godt eksempel er Inkling. I målingen ligger Inkling rundt 839 i AA-Briefcase Elo, foran DeepSeek V4 Flash max og klart foran Gemini 3.5 Flash-Lite i denne testen. Det betyr ikke at Inkling er «best» som generell bedriftsmodell. Det betyr at modellen har målbar nytte i en type agentisk kontorarbeid, men også at organisasjoner bør se på hvilke delmål den faktisk løser: analytisk kvalitet, presentasjon, tokenbruk, antall runder og evnen til å håndtere uvanlige filtyper. Det er mer nyttig enn en enkel topp-ti-liste.

For virksomheter som vurderer AI-agenter, er poenget praktisk: Benchmarks må begynne å ligne på arbeidsoppgavene man faktisk vil automatisere. Hvis en agent skal gjøre månedsrapportering, tilbudsanalyse, leverandørsammenligning eller policy-arbeid, er det svakt beslutningsgrunnlag å kun se på chat-kvalitet eller kodetester. Man trenger målinger som viser om modellen kan ta rotete inngangsdata og ende med en leveranse som er riktig nok, pen nok og sporbar nok til at en ansatt tør å sende den videre.

AA-Briefcase gjør også kostnadssiden mer synlig. Agentiske leveranser kan bruke mange tokens og mange turer før de blir ferdige. En modell som ser billig ut per million tokens kan bli dyr hvis den trenger mange forsøk, lager svake mellomprodukter eller krever tung menneskelig etterkontroll. Omvendt kan en dyrere modell være billigere i praksis hvis den raskere produserer en ferdig leveranse med færre feil. Det er nettopp denne typen regnestykke ledere må få på bordet før AI-agenter rulles ut bredt.

CISO-vinkelen er like viktig. Jo mer agentene får tilgang til dokumenter, regneark og interne prosjektfiler, desto viktigere blir logging, datatilgang, output-kontroll og evals som kan kjøres på egne oppgaver. En ekstern leaderboard er ikke en sikkerhetsgodkjenning. Den er et signal. Virksomheter bør bruke den til å velge kandidater for pilot, men teste modellene på egne anonymiserte arbeidsflyter før de får tilgang til sensitive data.

Konklusjonen er enkel: AA-Briefcase er ikke bare enda en benchmark. Den peker mot en mer moden måte å måle AI-agenter på. For ledere er det gode nyheter. Modellvalg bør handle mindre om hvem som vinner en demo, og mer om hvem som faktisk kan levere arbeid med riktig kvalitet, kostnad og kontroll.

Kilder og medier

Primærkilde: Artificial Analysis – https://artificialanalysis.ai/evaluations/aa-briefcase X-annonsering: Artificial Analysis – https://x.com/ArtificialAnlys/status/2080036845161730284 Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.