Mistral OCR 4: dokument-AI som aldri forlater huset
Mistral slapp en dokumentmodell som kjører i din egen container, dekker 170 språk og aldri sender siden ut av huset. For regulerte bransjer er det poenget.

Begreper i denne artikkelen
Mistral lanserte 23. juni OCR 4, en dokumentmodell bygget for virksomheter som ikke kan sende sensitive sider til en sky-API. Den kjører som én container på egen infrastruktur, dekker 170 språk og returnerer ikke bare tekst, men bounding boxes, typede blokker og konfidensskår for hvert felt. Prisen starter på 4 dollar per 1000 sider, halvparten med batch.
Hva den faktisk gjør
OCR handler ikke lenger bare om å lese tekst. OCR 4 klassifiserer struktur: tabeller, overskrifter, signaturfelt, avkrysninger. Utdataene er maskinlesbare og siterbare, klare for RAG-pipelines og agentiske arbeidsflyter. I en blindtest på over 600 reelle dokumenter foretrakk uavhengige annotatører OCR 4 fremfor konkurrentene i 72 prosent av tilfellene, ifølge Mistral. Tallet er leverandørrapportert, men et testoppsett med eksterne annotatører er mer etterprøvbart enn en ren benchmark-score fra leverandøren selv.
Hvem den er for
Målgruppen er tydelig: helse, finans og offentlig sektor, virksomheter der GDPR og datasuverenitet gjør sky-OCR til en juridisk hodepine. Mistral er registrert i Frankrike og underlagt EU-jurisdiksjon, og containeren betyr at dokumentene aldri forlater kundens eget miljø. Modellen er tilgjengelig via Mistrals API, Amazon SageMaker og Microsoft Foundry.
Anbefalingen
For norske virksomheter som i dag nøler med å digitalisere arkiver fordi innholdet er sensitivt, senker OCR 4 terskelen konkret. Prisen er lav nok til å teste i produksjon, og on-prem-modellen fjerner den vanligste innvendingen fra personvernombudet. Den som allerede kjører dokumentflyt mot en amerikansk sky, har nå et europeisk alternativ som ikke krever at dataene bytter kontinent.


