Как начать пользоваться Mistral OCR 4: извлечение данных из документов
Инструмент от Mistral AI превращает PDF, сканы и таблицы в структурированные данные -- с координатами блоков, классификацией и поддержкой 170 языков
Что это и для кого
Mistral OCR 4 -- это специализированная модель для анализа и извлечения данных из документов, выпущенная компанией Mistral AI 23 июня 2026 года. Аббревиатура OCR (Optical Character Recognition) означает оптическое распознавание символов, но Mistral OCR 4 -- это нечто значительно большее, чем традиционный OCR. Обычный OCR просто «читает» текст с изображения. Mistral OCR 4 возвращает вместе с текстом координаты каждого блока на странице (bounding boxes), тип блока (заголовок, таблица, формула, подпись, изображение), уровень уверенности на уровне каждого слова и блока -- и всё это в структурированном формате, готовом для дальнейшей обработки в программах или AI-системах.
Инструмент поддерживает 170 языков из 10 языковых групп, включая русский, и может обрабатывать PDF-файлы, отсканированные документы, фотографии страниц, таблицы, формы, контракты и научные статьи с формулами. По данным независимого бенчмарка OlmOCRBench на момент релиза модель набирает 85,20 -- лучший результат среди всех протестированных систем для анализа документов. В слепом тестировании независимые аннотаторы предпочли результаты Mistral OCR 4 результатам конкурирующих систем в 72% случаев.
Для кого это актуально? В первую очередь -- для бизнеса, который работает с большим объёмом документов: юридические и бухгалтерские компании, банки, страховые организации, логистика, медицинские учреждения. Если вам нужно массово обрабатывать накладные, договоры, медицинские карты, таможенные декларации или научные статьи -- Mistral OCR 4 автоматизирует то, что раньше требовало ручного труда или дорогих специализированных систем.
Также инструмент полезен разработчикам, которые строят RAG-системы (retrieval-augmented generation) и AI-агентов для работы с корпоративными документами. Mistral OCR 4 интегрирован в Search Toolkit Mistral -- готовый конвейер от загрузки документа до ответа на вопрос по его содержанию с указанием источников. Немаловажно, что Mistral OCR 4 можно развернуть в собственной инфраструктуре (self-hosting): модель поставляется в виде одного Docker-контейнера, что критично для организаций, которые не могут отправлять конфиденциальные документы в сторонние облачные API.
Важно понимать, что OCR 4 -- узкоспециализированный инструмент для работы с документами, а не универсальный AI-ассистент. Он не ведёт диалог и не отвечает на вопросы сам по себе. Его задача -- структурировать входящий документ так, чтобы с ним мог эффективно работать следующий компонент системы: языковая модель, поисковый индекс или база данных.
Как зарегистрироваться и начать
Самый простой способ начать -- через Mistral Studio без написания кода. Зайдите на сайт mistral.ai и нажмите «Try Studio». Зарегистрируйтесь через Google-аккаунт или по email -- это бесплатно и занимает менее минуты. В Mistral Studio найдите раздел «Document AI» в боковом меню. Здесь вы можете загрузить PDF или изображение напрямую через интерфейс и получить структурированный вывод без написания кода. Для быстрого тестирования это самый удобный путь.
Для работы через API нужно получить API-ключ. После регистрации в Mistral Studio перейдите в раздел «API Keys» в настройках аккаунта и создайте новый ключ. Сохраните его в безопасном месте -- он понадобится для всех последующих программных запросов. API Mistral OCR 4 работает по адресу api.mistral.ai и совместим со стандартным REST-форматом с JSON-ответами.
Установка Python-библиотеки: pip install mistralai. Затем в коде: from mistralai import Mistral; client = Mistral(api_key='ваш_ключ'). Для обработки документа по URL: response = client.ocr.process(model='mistral-ocr-4-0', document={'type': 'document_url', 'document_url': 'https://пример.com/документ.pdf'}). Результат содержит извлечённый текст в формате Markdown, координаты блоков и классификацию каждого элемента. Также можно передавать документы в формате base64 или предварительно загружать их через Files API Mistral для многократного использования.
Если вам нужен вариант с самохостингом (без передачи данных во внешние сервисы), Mistral предоставляет Docker-контейнер с моделью корпоративным клиентам. Контейнер разворачивается на собственных серверах и работает в изолированной сети. Это важно для организаций, работающих с персональными данными и обязанных соблюдать требования 152-ФЗ или отраслевые нормативы безопасности.
Mistral OCR 4 также доступен через Microsoft Azure AI Foundry -- для компаний, уже использующих инфраструктуру Microsoft, это часто самый удобный путь. Настройка аналогична стандартному Azure AI Studio с использованием Mistral-моделей через managed endpoint.
Первый запуск -- что попробовать
Начните с простого теста в Mistral Studio. Загрузите любой PDF-документ с таблицами -- например, банковскую выписку, прайс-лист или отчёт. Нажмите «Process» и посмотрите на результат: вы получите не просто текст, а структурированный Markdown с сохранённой структурой таблицы, заголовков и абзацев. Попробуйте также документ на русском языке -- качество распознавания кириллицы находится на том же уровне, что и для текста на латинице.
Чтобы увидеть возможности bounding boxes, нужен API. Сделайте запрос с параметром include_blocks: true (это доступно только для mistral-ocr-4-0 и новее). В ответе вы получите не только текст, но и для каждого блока -- координаты на странице в пикселях, тип блока (paragraph, table, equation, figure, header, footer, signature и другие) и уровень уверенности модели. Это позволяет, например, автоматически извлекать только таблицы из документа или визуально выделять блоки с низкой уверенностью для ручной проверки.
Попробуйте обработать многостраничный документ -- например, скан договора из 20-30 страниц. OCR 4 обрабатывает каждую страницу параллельно и возвращает результат значительно быстрее, чем последовательные системы. Для разработчиков, строящих RAG-системы, попробуйте комбинацию Mistral OCR 4 и Mistral Search Toolkit. Это готовый конвейер: документ загружается, OCR 4 извлекает и структурирует содержимое, Search Toolkit индексирует блоки, а затем языковая модель отвечает на вопросы по документу с точными ссылками на источники -- вплоть до конкретной страницы и координат блока.
Интересный сценарий -- обработка документов с формулами и нестандартным форматированием. Если вы работаете с научными статьями, финансовыми моделями или техническими спецификациями, OCR 4 корректно классифицирует математические выражения как equation-блоки и извлекает их отдельно, не путая с обычным текстом. Штампы, печати и подписи также определяются как отдельные типы блоков -- это удобно для автоматической верификации документов.
Ключевые фишки
Bounding boxes -- пожалуй, главное отличие от традиционных OCR-систем. Для каждого блока модель возвращает точные координаты (x, y, ширина, высота) на странице. Это позволяет создавать системы, которые не просто читают документ, но и понимают его пространственную структуру: автоматически находят подписи под таблицами, связывают сноски с соответствующими абзацами, корректно разбирают многоколоночные макеты.
Typed block classification: OCR 4 автоматически определяет тип каждого блока документа. Полная таксономия включает: title (заголовок документа), heading (подзаголовок раздела), text (основной текст), table (таблица), table_cell (ячейка таблицы), figure (изображение/диаграмма), figure_caption (подпись к изображению), equation (математическая формула), code (блок кода), а также signature, stamp, handwriting. Это избавляет от необходимости писать эвристики для разбора структуры документа вручную и существенно упрощает последующую обработку в RAG-системах и AI-агентах.
Inline confidence scores: уровень уверенности возвращается как для всего блока, так и для каждого отдельного слова. Это позволяет автоматически маршрутизировать проблемные фрагменты (например, рукописный текст или сильно повреждённый скан) на ручную проверку, не обрабатывая весь документ вручную и снижая затраты на постобработку.
Self-hosting: модель поставляется в виде единого Docker-контейнера без внешних зависимостей. Организации в регулируемых отраслях (финансы, здравоохранение, государственный сектор) могут развернуть OCR 4 в собственном контуре безопасности, гарантируя, что документы не покидают корпоративную сеть.
Интеграция с Search Toolkit: Mistral OCR 4 является частью комплексного решения для корпоративного поиска. Документы, обработанные OCR 4, автоматически попадают в поисковый индекс с сохранением типизированных блоков. Это позволяет строить RAG-системы, где ответ языковой модели сопровождается ссылкой на конкретный абзац или таблицу в исходном документе.
Широкая языковая поддержка -- 170 языков из 10 языковых семей. OCR 4 одинаково хорошо работает с документами на русском, арабском, китайском, хинди, японском и редких языках. Для международных компаний, обрабатывающих документы из разных стран в едином конвейере, это исключает необходимость в разных системах для разных языков.
Цены и ограничения
Ценообразование Mistral OCR 4 -- постраничное. На момент написания стоимость через стандартный API составляет 4 USD за 1000 страниц. При использовании Batch API (пакетная обработка с задержкой до 24 часов) действует скидка 50% -- итого 2 USD за 1000 страниц. Использование через интерфейс Document AI в Mistral Studio тарифицируется по цене 5 USD за 1000 страниц на момент написания -- это удобный вариант для разовых задач без написания кода. Для сравнения, традиционные корпоративные OCR-системы типа ABBYY FlexiCapture обходятся в десятки раз дороже на сопоставимом объёме. Актуальные тарифы всегда смотрите на mistral.ai/pricing, так как цены могут меняться.
Для тестирования доступен бесплатный уровень с ограниченным числом страниц в месяц -- достаточно, чтобы оценить качество перед масштабированием. Точные лимиты бесплатного уровня уточняйте на странице тарифов, так как они периодически пересматриваются. Mistral также предлагает корпоративные тарифы при больших объёмах -- имеет смысл уточнить у менеджера Mistral при планируемом объёме свыше 100 000 страниц в месяц.
Из ограничений стоит учитывать следующее. Во-первых, параметр include_blocks с возвратом bounding boxes доступен только в модели mistral-ocr-4-0 и новее -- в более ранних версиях Mistral OCR эта функция отсутствует. Во-вторых, для самохостинга требуется отдельное соглашение с Mistral AI -- Docker-контейнер доступен только корпоративным клиентам по отдельному контракту. В-третьих, модель ориентирована на обработку текстовых документов, а не на описание фотографий или художественных изображений. В-четвёртых, качество на сильно повреждённых или преимущественно рукописных документах может быть ниже -- именно для таких случаев важны confidence scores.
Нужен ли VPN из России
Mistral AI -- французская компания, её сервисы официально доступны в России без ограничений. Mistral Studio и API работают без VPN из большинства российских сетей. Если у вас возникают проблемы с подключением к mistral.ai или api.mistral.ai, это, скорее всего, связано с особенностями вашего интернет-провайдера, а не с географическими ограничениями со стороны Mistral.
Если вы планируете использовать Mistral OCR 4 через Microsoft Azure AI Foundry, учтите, что Azure-сервисы могут иметь ограничения по регионам в зависимости от типа вашей подписки. Для российских корпоративных клиентов Azure рекомендуется уточнить доступность Mistral-моделей в вашем регионе Azure напрямую у Microsoft или через партнёров.
Для варианта с самохостингом (Docker-контейнер) VPN вообще не нужен после первоначального развёртывания -- система работает полностью внутри вашей инфраструктуры без исходящих запросов к внешним серверам. Именно поэтому самохостинг часто является предпочтительным вариантом для российских организаций, работающих с персональными данными и требующих соответствия требованиям 152-ФЗ о локализации персональных данных.
Регистрация на mistral.ai доступна без VPN. После получения API-ключа все запросы к API также работают без VPN из большинства российских сетей. Если вы работаете через корпоративный прокси или в контуре с ограниченным интернет-доступом -- уточните у администратора, открыт ли доступ к api.mistral.ai на стандартном порту 443 (HTTPS).
Keyword biasing для специализированной терминологии: Mistral OCR 4 поддерживает передачу списка ключевых терминов -- названия продуктов, имена, отраслевой жаргон, аббревиатуры. Модель приоритизирует распознавание этих слов при неоднозначном изображении. По данным Mistral, применение keyword biasing снижает количество ошибок распознавания (Error Rate) на 30% для профессиональной терминологии. Особенно актуально для юридических, медицинских и технических документов с нестандартной лексикой.
Обновление: доступность и API
Mistral OCR 4 доступен не только через Mistral Studio, но и через Microsoft Azure AI Foundry и Amazon SageMaker. Скоро: поддержка через Snowflake Parse Document. В API параметр pages теперь принимает строки-диапазоны: '0-5' или '0,2-4' в дополнение к спискам целых чисел.
Обновления API Mistral OCR 4 (июль 2026)
Параметр include_blocks: true возвращает структурированные блоки с paragraph-level bounding boxes и метками типа: paragraph, table, equation, figure, header, footer, signature. Это позволяет автоматически извлекать только нужные типы элементов (например, все таблицы или уравнения) без ручной разметки. Параметр доступен только в модели mistral-ocr-4-0 и новее.
Параметр pages теперь принимает строковые диапазоны: например, "0,2-4" выбирает первую страницу и страницы с третьей по пятую. Это позволяет точечно обрабатывать нужные разделы документа без полной конвертации. Mistral OCR 4 также доступен через Amazon SageMaker в дополнение к Mistral Studio и Microsoft Azure AI Foundry. Интеграция через Snowflake Parse Document анонсирована и ожидается в ближайшее время.
Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором.
Хотите получать подобные материалы раньше?
Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.
Узнать про IntelligenceНе пропускайте важное
Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.
Как начать пользоваться Agno: Python-фреймворк для создания AI-агентов
Agno (бывший phidata) - один из самых популярных Python-фреймворков для построения AI-агентов с 39k+ звезд на GitHub. Пошаговый гайд: установка, первый агент за 5 минут, мультиагентные команды и деплой в продакшн.
Seedance 2.5: как начать пользоваться генератором видео от ByteDance
Seedance 2.5 от ByteDance генерирует нативное 30-секундное видео в один проход, принимает до 50 мультимодальных референсов и позволяет редактировать отдельные фрагменты без перегенерации всего клипа.
ChatGPT Work: как начать пользоваться агентным рабочим столом OpenAI
9 июля 2026 OpenAI запустила ChatGPT Work -- агента, который берёт у вас целый проект, сам планирует шаги, работает часами в фоне и возвращает готовый документ, таблицу или презентацию.