Меньшая нейросеть, обученная на одном языке, превзошла две более крупные и новые модели в чтении португальского языка Бразилии

DharmaOCR показала лучший результат, чем Mistral OCR4 и Unlimited-OCR на португальском тесте, и причина кроется в специализации, а не в размере модели.

AI2Day NewsdeskUpdated Editor: Lee Brown3 min read
A close-up, photoreal, news-editorial style 16:9 image of a stack of handwritten exam papers on a wooden desk, shot from slightly above at an angle, warm natura
Share

Ключевые моменты

  • DharmaOCR набрала 0,925 балла на бразильском португальском эталоне, против 0,798 для Mistral OCR4 и 0,7587 для Unlimited-OCR.
  • Обе конкурирующие модели были выпущены после DharmaOCR и поддерживались более крупными исследовательскими командами.
  • DharmaOCR обучалась в два этапа: сначала на португальских документах, затем на сравнительной обратной связи для снижения ошибок и уменьшения затрат вычислительных ресурсов.
  • Различие было наиболее заметно на реальных бразильских документах, таких как эссе ENEM, национального экзамена средней школы Бразилии.
  • Концентрация — структурное преимущество: каждый параметр нацелен на один язык, а не на десятки.

Небольшая специализированная нейросеть только что превзошла двух более новых и лучше финансируемых конкурентов в чтении текста на португальском языке Бразилии. Разница была значительной.

DharmaOCR, модель распознавания текста (программное обеспечение, которое читает текст со сканированных документов и изображений и преобразует его в редактируемый текст), созданная специально для португальского языка Бразилии, набрала 0,925 балла на специализированном португальском эталоне. Mistral OCR4 набрала 0,798. Unlimited-OCR набрала 0,7587. Это разница в 13–16 процентных пункта в пользу более старого и специализированного инструмента.

Исследователи поделились своими выводами на Hugging Face, платформе, где команды AI публикуют модели и работы. AI2Day впервые рассказала о DharmaOCR 16 июля 2026 года.

Почему специализированная модель победила?

Специализация победила, потому что каждый параметр был направлен на одну цель. Многоязычная модель распределяет свою емкость между языками; одноязычная модель концентрирует её на одном словаре, одном наборе орфографических соглашений, одном семействе форматов документов.

DharmaOCR была создана в два этапа. На первом этапе её обучали на португальских документах различных форматов и уровней сложности, выравнивая её внутренние веса с бразильским словарём и структурой документов. На втором этапе применялась техника Direct Preference Optimization (DPO), где модель не только училась распознавать правильный ответ, но и различала, какой из двух конкурирующих результатов предпочтительнее. DPO решала иную задачу, чем точность: она подавляла режимы отказа, где инструменты AI-текста зацикливаются, зависают или выдают искажённый результат, снижая как количество ошибок, так и затраты вычислений.

Точность и стабильность. Оба этапа были необходимы.

Должны ли вас удивить ошибки в именах?

Наиболее яркие доказательства пришли из эссе ENEM, рукописных экзаменационных работ, в которых смешаны курсивные буквы со словарём и культурными ссылками, специфичными для Бразилии.

Mistral OCR4 прочитала имя Чико Буарки, известного бразильского музыканта и поэта, как «Chico Barque». Unlimited-OCR передала то же имя как «chico bique» и превратила цитату Буарки в почти бессмыслицу. DharmaOCR прочитала обе правильно.

Знаменитые имена — не исключительные случаи. Их неправильное распознавание указывает на то, что модель не потратила достаточно времени в этом конкретном лингвистическом пространстве, и это надёжный признак того, что произойдёт с вашими документами, когда словарь станет более специфичным.

Часто задаваемые вопросы

Означает ли это, что меньшие модели всегда лучше?

Нет. Меньшая модель выигрывает здесь, потому что задача узкоспециализирована. Если вам нужен один инструмент для обработки дюжины языков, многоязычная модель — практический выбор. Результат показывает, что оценки в широких эталонах не всегда предсказывают производительность на ваших конкретных документах.

Что следует делать перед покупкой инструмента AI?

Протестируйте инструмент, созданный для вашей конкретной задачи, на ваших реальных документах. Самая крупная доступная модель не всегда выигрывает в работе, которую вам нужно выполнить. Это не критика больших моделей; это то, как работает специализация.

© 2026 AI2Day