Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face • Bloomberg: NVIDIA-kunder varsles om over 15 prosent prishopp på AI-servere • OpenAI kutter GPT-5.6 Sol mer enn 20 prosent – i tre måneder

Journal-AI treffer fakta, men misser saken i MLCR-AA
AI-modellerArtificial AnalysisHelseEnterpriseCIO

Journal-AI treffer fakta, men misser saken i MLCR-AA

JH
Joachim Høgby
21. august 202621. august 20265 min lesingKilde: Artificial Analysis

Nøyaktighet er ikke det samme som journalgjennomgang. Artificial Analysis har sluppet MLCR-AA, en uavhengig kjøring av Wisedocs-benchmarken Medical Long Context Reasoning. Testen tar de hardeste sakene: ekspertnivå klinisk syntese og sammensatte flerspørsmål. Beste modell, Claude Fable 5 med adaptiv resonnering, maks innsats og Opus 4.8-fallback, tar 64,4 prosent. Medianen blant publiserte modeller ligger under 15 prosent. Det er et innkjøpstall, ikke et forskningskuriosa.

MLCR er bygd for arbeidet en skadebehandler eller medisinsk reviewer faktisk gjør. Sakene er syntetiske, men satt sammen som ekte journaler: 25 000 til 64 000 token, 50 til 150 notater på tvers av spesialiteter, og spørsmål som krever kronologi, kausalitet og relevans. Offentlig datasett dekker de enklere trinnene. AA evaluerer et privat hold-out-sett med de to hardeste kategoriene. Hvert spørsmål kjøres tre ganger. Svaret må være konsist, innen fem ganger referanselengden. Deretter stemmer tre modelldommere, Gemini 3.1 Pro, Claude Opus 4.8 og GPT-5.5, over nøyaktighet og completeness. Overlange og tomme svar teller som null. Poeng gis bare når svaret er kort nok, faktisk riktig og komplett.

Det skillet er hele saken. GPT-5.6 Terra (max) leder nøyaktighet med 93,7 prosent blant bedømte svar. GPT-5.6 Sol (max) følger på 92,5. Fable 5 ligger på 90,1. Completeness peker motsatt vei. Claude Opus 5 (max) tar 86,1 prosent. Opus 5 xhigh og high ligger på 81,8 og 81,2. Fable 5, som vinner totalt, har ifølge AA 73,8 prosent completeness. Terra, som nesten ikke hallusinerer, har 33,9 prosent completeness og faller til rundt tiendeplass totalt. Modellene er lojale mot kilden når de skriver. De dropper nøkkeldetaljer en sakkyndig ville tatt med.

Claude-linjen eier toppen. Etter Fable 5 kommer Opus 5 high på 59,4 prosent og Opus 5 xhigh på 58,3. Åpen-vekter-lederen er Kimi K3 (max) på 38,3 prosent. AA viser 17 av 69 modeller i første snapshot. Anthropic-kjøringene koster grovt 0,3 til 1 dollar per oppgave. Det er billig mot en human reviewer og dyrt mot en naiv «send hele journalen til billigmodell»-plan, fordi de billige modellene faller gjennom completeness-porten.

For en CIO eller medisinsk direktør er lærdommen konkret. Ikke kjøp journal-AI på nøyaktighet alene. En modell som nesten aldri lyver, men som utelater tredjedeler av det en ekspert forventer, er farligere i skadeoppgjør enn en modell som innrømmer hull. Completeness-svikt i denne testen betyr manglende funn, ikke pynt. Eksempeltaskene viser hvorfor: dato og rekvirent for en lumbal MR, behandlingslinje for et kne på tvers av ortopedi, fysioterapi og bildediagnostikk, og om et prolaps hører til arbeidsulykken eller degenerativ sykdom. Det siste er ekspert- og compound-nivå. Det er også der modellene knekker.

CISO-vinkelen er like tørr. Journal og skadefiler er særlige kategorier. Syntetiske case fjerner personvern i selve evalen, men produksjon gjør det ikke. Hvis dere tester leverandører mot MLCR-lignende oppgaver, må dere styre hvor filene ligger, hvem som er databehandler, og om svaret kan brukes som beslutningsstøtte uten menneskelig sign-off. AA understreker at MLCR-AA ikke inngår i Intelligence Index. Det er en frittstående, uavhengig kjøring. Tallene kan derfor ikke regnes hjem som «vi ligger på topp i AA-indeksen». De kan brukes til å avvise leverandører som bare viser needle-in-a-haystack eller kort kontekstoppslag.

Begrensningene er ærlige. Sakene er syntetiske. Dommerne er modeller. AA og Wisedocs bruker ulike delsett og ulike terskler, så tallene kan ikke sammenlignes direkte med Wisedocs’ egen rapport. Offentlig sett slippes de lettere trinnene. De hardeste spørsmålene holdes privat nettopp for å hindre overtrening. Det er riktig eval-design. Det betyr også at dere ikke kan reprodusere topp-tallet internt uten avtale. Det dere kan reprodusere, er metoden: krev både nøyaktighet og completeness, straff verbositet, og test compound-spørsmål, ikke enkeltfakta.

Wisedocs’ egen blogg viser hvorfor tenkemodus ikke er en automatisk oppgradering. På de hardeste trinnene hjalp medium thinking noen modeller og svekket andre. Mer resonnering gir mer tekst. Mer tekst treffer AA sin fem-ganger-port. For produksjon betyr det at «skru tenking på max» kan senke passraten hvis svaret blir et essay.

Anbefalingen til ledergruppen er derfor smal. Bruk MLCR-AA som sil, ikke som sertifikat. Be leverandøren om nøyaktighet og completeness hver for seg, på de hardeste sakene, med kost per oppgave. Ikke godta en demo som finner én MRI-dato. Be om kausalitetsvurdering på tvers av hele journalen, og om modellen sier ifra når noe ikke står i dokumentet. Der stopper de fleste modellene fortsatt. 64,4 prosent er ledelse i en umoden kategori. Det er ikke klart for autonom skadebehandling.

Kilder og medier

Primærkilde: Artificial Analysis, Medical Long Context Reasoning (MLCR-AA): https://artificialanalysis.ai/evaluations/mlcr-aa

Wisedocs, Benchmarking LLMs For Medical Document Work: https://www.wisedocs.ai/blogs/medical-long-context-reasoning

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.