Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Anthropic gjør Claude Opus 5 til ny toppmodell for agentarbeid • Falske AI-plugins stjal utviklernes API-nøkler • AI-agentpakker på npm ble kapret i 27 minutter • Beijing tvinger Meta til å reversere Manus-kjøp • Amazon-varsel forklarer Anthropic-sperren

Mistral gjør dokument-AI enklere å flytte hjem
CIOCISOCTODPOStyreMistral AIOCRDocument AIRAGEnterprise AISovereign AIData GovernanceSelvhostingPersonvernKoststyringAI GovernanceLeverandørstyring

Mistral gjør dokument-AI enklere å flytte hjem

JH
Joachim Høgby
24. juni 202624. juni 20264 min lesingKilde: Mistral AI

Mistral har lansert OCR 4, en ny modell for dokumentforståelse som retter seg rett mot en av de mest praktiske flaskehalsene i enterprise-AI: å få ustrukturerte dokumenter inn i søk, RAG og arbeidsflyter uten at kildegrunnlaget blir grøt.

Lanseringen er ikke en ny språkmodell i frontlinjen. Den er mer interessant fordi den treffer noe de fleste virksomheter faktisk sliter med. Kontrakter, rapporter, tilbud, tekniske manualer, møtereferater, produktark og skannede arkiver er fortsatt råstoffet i mange AI-prosjekter. Hvis inntaket er svakt, hjelper det lite at modellen på toppen er sterk.

OCR 4 returnerer ikke bare tekst. Mistral sier modellen gir bounding boxes, klassifisering av blokker som titler, tabeller, ligninger og signaturer, samt konfidensscore på sidenivå og ordnivå. Det gjør resultatet mer egnet for systemer som må vise hvor et svar kommer fra, la mennesker kontrollere usikre felt, eller sensurere data før videre behandling.

Modellen støtter 170 språk på tvers av ti språkgrupper. Den tar vanlige virksomhetsformater som PDF, DOC, PPT og OpenDocument. Mistral fremhever også at modellen kan kjøres i én container og selvhostes for enterprise-kunder. Det er et viktig poeng for europeiske og norske virksomheter som ikke kan sende store mengder kontrakter, pasientdata, personalmapper eller kundedokumentasjon ut i en tilfeldig API-flyt.

Prisbildet er også konkret nok til å høre hjemme i et ledermøte. Mistral oppgir 4 dollar per 1 000 sider via API, med 50 prosent batch-rabatt som senker prisen til 2 dollar per 1 000 sider. Document AI-laget, som legger mer struktur og instruksjoner på toppen, prises til 5 dollar per 1 000 sider.

Det betyr ikke at Mistral automatisk er riktig valg. Leverandørens egne tall bør behandles som startpunkt, ikke fasit. Mistral viser til 72 prosent gjennomsnittlig preferanse hos annotatører mot konkurrerende OCR- og dokument-AI-systemer, og toppscore på OlmOCRBench. Slike tall er nyttige, men dokumentporteføljer er lokale. En norsk kommune, et industrikonsern og et advokatfirma har helt ulike dokumenter, språkblandinger, tabeller og signaturkrav.

Den praktiske nyheten er derfor ikke at «OCR er løst». Den er at dokument-AI begynner å bli mer driftbar. Bounding boxes, blokktype og konfidensscore er styringsdata. De gjør det mulig å sette terskler: når kan agenten svare selv, når skal saken til saksbehandler, og når skal dokumentet avvises fordi kvaliteten er for lav?

For CIO og CISO er spørsmålet mindre teknisk enn det ser ut. Mange virksomheter har allerede RAG-prosjekter som leser dokumenter og svarer ansatte. Få har gode nok kontroller rundt dokumentinntaket. Hvem eier feiltolkede tabeller? Hvordan beviser man hvilken side et svar bygger på? Hvor lagres mellomresultatene? Kan systemet kjøres innenfor egne databehandleravtaler? Hva skjer når dokumentene inneholder både persondata og forretningshemmeligheter?

OCR 4 peker mot en mer moden arkitektur: dokumentinntak som egen komponent, søk og evaluering som egne lag, og språkmodellen som siste ledd. Det er sunnere enn å dytte PDF-er rett inn i en chatbot og håpe på det beste. Det gjør også bytte av modell lettere senere. Dokumentstrukturen kan bli en varig del av plattformen, mens språkmodellen kan skiftes ut etter pris, kvalitet og regulatorisk risiko.

Norske virksomheter bør teste dette på egne dokumenter før de kjøper historien. Velg et sett med vanskelige PDF-er, skannede vedlegg, tabeller, flere språk og håndskrevne felt. Mål ikke bare teksttreff. Mål sporbarhet, feilrate i tabeller, konfidensscore mot faktisk feil, kjøretid, kost per dokument og hvor lett output kan brukes i arkiv, saksbehandling og RAG.

Hvis testen holder, er dette en nyttig påminnelse: de mest lønnsomme AI-prosjektene i 2026 kan ligge nærmere dokumentflyt enn demoer med blank chatflate.

Kilder og medier

  • Primærkilde: Mistral AI, «Mistral OCR 4 : SOTA OCR for Document Intelligence», https://mistral.ai/news/ocr-4/
  • Kildekreditering: Mistral AI.
  • Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.