Получить КП

Mistral AI выпустила OCR 4: структурное распознавание документов с self-hosted и 170 языками

Mistral AI выпустила OCR 4: структурное распознавание документов с self-hosted и 170 языками

23 июня 2026 года Mistral AI выпустила OCR 4 — четвёртое поколение модели оптического распознавания документов за 15 месяцев. Ключевое отличие от предыдущих версий: OCR 4 не просто извлекает текст, а возвращает структуру документа — bounding boxes, классификацию блоков (заголовок, таблица, подпись, уравнение) и постраничные confidence scores.

Что нового в Mistral OCR 4

Модель поддерживает 170 языков и работает как единый контейнер для полностью self-hosted развёртывания. OCR 4 доступна через Mistral API, Amazon SageMaker и Microsoft Foundry, интеграция со Snowflake Parse Document анонсирована.

  • Bounding boxes — координаты каждого элемента на странице для точного позиционирования
  • Классификация блоков — модель различает заголовки, подзаголовки, таблицы, уравнения, подписи к изображениям
  • Confidence scores — постраничные и поэлементные оценки уверенности
  • Markdown-вывод — структурированный результат готов к интеграции в RAG-пайплайны
  • 170 языков — 10 языковых групп, включая кириллицу
  • Self-hosted — единый Docker-контейнер для развёртывания на собственных серверах

Цены и доступность

API-доступ — $4 за 1000 страниц, пакетный режим со скидкой 50% — $2 за 1000 страниц. Для enterprise-клиентов доступна on-premise установка через контейнер.

Модель также встроена в Le Chat — чат-помощник Mistral AI — для загрузки и анализа документов прямо в интерфейсе.

Бенчмарки и позиционирование

На бенчмарке OlmOCRBench OCR 4 показала результат 85.20 балла. В независимых тестах с участием аннотаторов модель предпочитали конкурентам в 72% случаев. Mistral позиционирует OCR 4 как компонент для enterprise-поиска, RAG и предметно-ориентированных пайплайнов извлечения данных.

Аналитики отмечают разделение рынка document AI в июне 2026: open-weight модели для self-hosted долгого горизонта обработки против управляемых корпоративных решений с расширенными функциями. OCR 4 занимает вторую нишу — структурированное управляемое извлечение.

Ключевые конкуренты на рынке

  • Google Document AI — облачное решение, только API, без self-hosted
  • Azure AI Document Intelligence — интеграция с экосистемой Microsoft, привязка к Azure
  • LlamaParse — open-source, но без bounding boxes и confidence scores
  • Tesseract — бесплатно, но значительное отставание по качеству на сложных документах

Почему это важно для бизнеса

Для российских компаний, работающих с документами на русском и других языках, OCR 4 интересна в первую очередь возможностью self-hosted развёртывания. Это критично для регулируемых отраслей — банков, страховых, госсектора — где данные нельзя отправлять в внешние API.

Возможность получить структурированное представление документа (не просто текст, а заголовки, таблицы, подписи) упрощает построение RAG-пайплайнов для корпоративных knowledge base, снижая затраты на preprocessing.

Для команд, которые уже используют Mistral API через корпоративных провайдеров, OCR 4 становится естественным дополнением к стеке — единый поставщик и для LLM, и для document AI.