Un modello di IA più piccolo addestrato su una sola lingua ha battuto due modelli più grandi e recenti nella lettura del portoghese brasiliano
DharmaOCR ha superato sia Mistral OCR4 che Unlimited-OCR in un test di lettura in portoghese, e il motivo dipende dalla specializzazione, non dalle dimensioni.

Punti chiave
- DharmaOCR ha ottenuto 0.925 su un benchmark di portoghese brasiliano, contro 0.798 per Mistral OCR4 e 0.7587 per Unlimited-OCR.
- Entrambi i modelli concorrenti sono stati rilasciati dopo DharmaOCR e supportati da team di ricerca più grandi.
- DharmaOCR è stato addestrato in due fasi: prima su documenti in portoghese specificamente, poi su feedback comparativo per ridurre gli errori e diminuire il tempo di calcolo sprecato.
- Il divario era più evidente su documenti brasiliani reali come i saggi ENEM, l'esame nazionale della scuola secondaria brasiliana.
- La concentrazione è il vantaggio strutturale: ogni parametro è orientato su una sola lingua anziché su decine.
Un piccolo modello di IA focalizzato ha appena superato due rivali più recenti e con più risorse nel leggere testi in portoghese brasiliano. Il margine non era per nulla serrato.
DharmaOCR, un modello OCR (software che legge il testo da documenti scansionati e immagini e lo converte in parole modificabili) costruito specificamente per il portoghese brasiliano, ha ottenuto 0.925 su un benchmark dedicato in portoghese. Mistral OCR4 ha ottenuto 0.798. Unlimited-OCR ha ottenuto 0.7587. È un divario di 13-16 punti percentuali a favore dello strumento più vecchio e specializzato.
I ricercatori hanno condiviso i loro risultati su Hugging Face, la piattaforma dove i team di IA pubblicano modelli e articoli. AI2Day ha coperto per la prima volta DharmaOCR il 16 luglio 2026.
Perché un modello più specializzato ha vinto?
La specializzazione ha vinto perché ogni parametro era orientato verso lo stesso obiettivo. Un modello multilingue distribuisce la sua capacità tra lingue; un modello monolingue la concentra su un vocabolario, una serie di convenzioni ortografiche, una famiglia di formati documentali.
DharmaOCR è stato costruito in due fasi. La prima fase lo ha addestrato su documenti in lingua portoghese di vari formati e livelli di complessità, allineando i suoi pesi interni al vocabolario brasiliano e alle strutture documentali. La seconda fase ha applicato una tecnica chiamata Direct Preference Optimization (DPO), dove il modello ha imparato non solo quale fosse la risposta corretta, ma quale di due output concorrenti fosse preferibile. DPO ha affrontato un problema diverso dalla precisione: ha soppresso i modi di fallimento in cui gli strumenti di testo AI si bloccano, si fermano o producono output confuso, riducendo sia i tassi di errore che i costi di inferenza.
Accurato e stabile. Entrambe le fasi erano necessarie.
Gli errori nei nomi dovrebbero sorprendervi?
La prova più chiara è venuta dai saggi ENEM, articoli d'esame scritti a mano che mescolano la scrittura corsiva con vocabolario e riferimenti culturali specifici del Brasile.
Mistral OCR4 ha letto il nome Chico Buarque, un musicista e poeta brasiliano ampiamente riconosciuto, come "Chico Barque." Unlimited-OCR ha reso lo stesso nome come "chico bique" e ha trasformato una citazione di Buarque in quasi-insensatezza. DharmaOCR ha letto entrambi correttamente.
I nomi famosi non sono casi particolari. Leggerli male segnala che un modello non ha passato abbastanza tempo in questo specifico spazio linguistico, ed è un indicatore affidabile di quello che accadrà sui vostri documenti quando il vocabolario diventa specifico.
Domande comuni
Questo significa che i modelli più piccoli sono sempre migliori?
No. Un modello più piccolo vince qui perché il compito è limitato. Se hai bisogno di uno strumento che gestisca una dozzina di lingue, un modello multilingue è la scelta pratica. Il risultato è che i punteggi di benchmark su valutazioni ampie non predicono affidabilmente le prestazioni sui tuoi documenti specifici.
Cosa dovresti fare prima di acquistare uno strumento di IA?
Testa quello costruito per il tuo compito esatto contro i tuoi documenti reali. Il modello più grande disponibile non sempre vincerà sul lavoro che devi fare. Non è una critica ai modelli di grandi dimensioni; è così che funziona la specializzazione.



