Открытые модели для распознавания документов

Модели OCR превращают сканы и фото документов в текст и структурированные данные: счета, накладные, договоры, таблицы. Это снимает ручной ввод в бухгалтерии и учётных системах. Проверьте поддержку кириллицы и рукописного текста, умение сохранять таблицы и разметку, а также условия лицензии.

В подборке 36 семейств открытых моделей.Обновлено 22.09.2026Открыть весь каталог с фильтрами
Документы и OCR2026

jina-ocr-v1

Jina AI · Германия

Разбор документов одной моделью: страница целиком превращается в Markdown — текст в правильном порядке чтения, таблицы и формулы в LaTeX. Построена на DeepSeek-OCR, активны только 0,6 млрд параметров из 3,4.

  • Перевод сканов и PDF в Markdown
  • Распознавание таблиц и формул
  • Разбор счетов, актов и отчётов
Размеры
3.4B-A0.6B
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Документы и OCR2026

TeleOCR

TeleAI (China Telecom) · Китай

Новая лёгкая модель для разбора документов, на момент выхода лидер теста OmniDocBench v1.6. Хорошо справляется со снятыми на телефон и помятыми страницами. Языки в карточке — китайский, английский, японский.

  • Распознавание счетов и накладных, снятых на телефон
  • Распознавание таблиц и формул
  • Перевод документов в Markdown для RAG
Размеры
около 1.2B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текстGGUF2024–2026

Ovis

Alibaba (AIDC-AI) · Китай

Модели зрения от международного подразделения Alibaba с сильным чтением текста и таблиц. В линейке есть MoE Ovis2.6 и отдельные компактные OvisOCR для документов.

  • Извлечение данных из счетов, договоров и накладных
  • Распознавание таблиц
  • Ответы на вопросы по фото и графикам
Размеры
0.9B – 80B-A3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCRRUGGUF2025–2026

HunyuanOCR

Tencent · Китай

Лёгкая OCR-модель Tencent: разбор документов, поиск текста на фото, извлечение полей и перевод текста с картинок. Версия 1.5 быстрее и запускается на обычном ПК.

  • Извлечение полей из счетов и накладных
  • Распознавание таблиц и формул
  • Перевод текста на фотографиях и сканах
Размеры
1B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Документы и OCRRU2024–2026

Surya OCR

Datalab · США

Компактный набор OCR от авторов Marker и Chandra: распознавание текста, макет страницы, порядок чтения и таблицы. Surya OCR 2 (650M) работает и на процессоре, русский в замерах 88,8%.

  • Распознавание сканов и PDF, в том числе на русском
  • Разметка страницы: заголовки, таблицы, картинки, порядок чтения
  • Распознавание таблиц по строкам и столбцам
Размеры
до 650M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Документы и OCR2026

Unlimited-OCR

Baidu · Китай

OCR-модель Baidu, развивающая идеи DeepSeek-OCR: разбирает многостраничные документы и PDF целиком за один проход и выдаёт размеченный текст. Заявлена как многоязычная, но список языков не опубликован.

  • Перевод многостраничных PDF и сканов в текст и Markdown
  • Распознавание договоров, счетов и отчётов
  • Подготовка архивов документов к поиску и RAG
Размеры
3.3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCRRU2022–2026

PP-OCR и PP-DocLayout (классический PaddleOCR)

Baidu (PaddlePaddle) · Китай

Классические лёгкие модели PaddleOCR: поиск и распознавание строк текста плюс разметка страницы. Работают на процессоре и телефонах; есть отдельная модель для восточнославянских языков, включая русский.

  • Распознавание текста на сканах, фото и экранах
  • Чтение этикеток, табло, маркировки на производстве и складе
  • Разметка страниц: таблицы, формулы, печати, заголовки
Размеры
от 1.5M до десятков миллионов параметров
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текстOllama2024–2026

MiniCPM-V

OpenBMB (ModelBest и Университет Цинхуа) · Китай

Компактные модели зрения, которые работают даже на телефоне и ноутбуке. Хорошо читают текст на фото, понимают видео; версия 4.6 весит всего 1.3B.

  • Распознавание текста на фото прямо на устройстве
  • Разбор чеков и документов без отправки в облако
  • Описание фото и видео
Размеры
1.3B – 8B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCRRUGGUF2025–2026

PaddleOCR-VL

Baidu (PaddlePaddle) · Китай

Компактная модель для разбора документов из популярного набора PaddleOCR. По карточке поддерживает 109 языков, в том числе русский; версия 1.6 лидирует на тесте OmniDocBench.

  • Распознавание счетов, договоров и накладных, в том числе на русском
  • Распознавание таблиц, формул, печатей
  • Перевод сканов в Markdown и JSON
Размеры
0.9B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCRGGUF2025–2026

MinerU

Shanghai AI Laboratory (OpenDataLab) · Китай

Популярный открытый инструмент перевода PDF в Markdown со своей небольшой моделью. MinerU2.5-Pro улучшили только за счёт данных, без роста размера. Языки в карточке — китайский и английский.

  • Перевод PDF-отчётов и договоров в Markdown
  • Распознавание таблиц и формул
  • Подготовка документов для RAG и поиска
Размеры
0.9B – 1.2B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текстOllama2025–2026

Granite Vision

IBM · США

Компактные модели IBM для корпоративных документов: таблицы, графики, формы, пары «поле — значение». Карточка честно предупреждает, что лучше всего работает с английским.

  • Извлечение полей из форм и счетов
  • Перевод графиков и таблиц в данные
  • Ответы на вопросы по документам
Размеры
2B – 4B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Разбор текстаOllama2024–2026

NuExtract

NuMind · Франция

Модели для извлечения данных по шаблону: даёте документ или скан и JSON-шаблон полей, получаете заполненный JSON. NuExtract3 (4B) заодно переводит сканы в Markdown.

  • Извлечение реквизитов, сумм и дат из счетов и договоров в JSON
  • Разбор чеков, накладных и анкет по заданному шаблону
  • Перевод сканов в Markdown для поиска
Размеры
0.5B – 8B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCRRUGGUF2025–2026

dots.ocr

rednote hilab (Xiaohongshu) · Китай

Многоязычная модель для разбора документов: текст, таблицы, формулы и порядок чтения за один проход. dots.mocr ещё переводит графики и схемы в векторный SVG.

  • Распознавание счетов, договоров и накладных
  • Перевод таблиц в редактируемый вид
  • Перевод графиков и схем в векторный формат
Размеры
около 3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCRRUGGUF2025–2026

Chandra OCR

Datalab · США

Сильная OCR-модель от авторов Marker и Surya: рукописный текст, формы, таблицы. По карточке поддерживает 90+ языков, русский есть среди примеров.

  • Распознавание счетов, договоров и накладных, в том числе на русском
  • Распознавание рукописных форм и анкет
  • Распознавание сложных таблиц
Размеры
5B – 9B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Документы и OCRRUGGUF2026

Qianfan-OCR

Baidu (Qianfan) · Китай

Модель Baidu, которая не только распознаёт документ, но и отвечает на вопросы по нему. По карточке поддерживает 192 языка, включая кириллицу.

  • Распознавание счетов, договоров и накладных, в том числе на русском
  • Разметка страницы и распознавание таблиц
  • Ответы на вопросы по документу
Размеры
4B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текст2026

Qwen3-VL Resume Parser

Sukhrob Nurali · не раскрыта

Дообученная Qwen3-VL-8B читает страницы резюме как картинки и возвращает запись из 23 полей в JSON. Автор прямо пишет: для автоматических решений по кандидатам модель не предназначена, решение принимает человек.

  • Перенос резюме из PDF в карточку кандидата
  • Заполнение базы кандидатов без ручного ввода
  • Разбор резюме с разной вёрсткой и оформлением
Размеры
8B, дообучение Qwen3-VL-8B-Instruct
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Документы и OCROllama2025–2026

DeepSeek-OCR

DeepSeek · Китай

OCR-модель, которая сильно сжимает страницу в небольшое число визуальных токенов, поэтому быстро обрабатывает большие объёмы. Версия 2 лучше понимает порядок чтения.

  • Массовое распознавание сканов счетов и договоров
  • Распознавание таблиц
  • Перевод PDF в Markdown для поиска и RAG
Размеры
около 3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCRRUOllama2026

GLM-OCR

Zhipu AI (Z.ai) · Китай

Лёгкая OCR-модель Zhipu для разбора документов. В карточке русский указан среди поддерживаемых языков; рассчитана на высокую нагрузку и слабое железо.

  • Распознавание счетов, договоров и накладных, в том числе на русском
  • Распознавание таблиц и формул
  • Извлечение полей в JSON
Размеры
0.9B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCRGGUF2025–2026

LightOnOCR

LightOn · Франция

Французская OCR-модель на 1B, которая переводит страницу в текст за один проход и быстро работает на потоке. Языки в карточке — европейские, китайский и японский, русского нет.

  • Распознавание счетов и договоров на европейских языках
  • Распознавание таблиц
  • Перевод PDF в текст для поиска и RAG
Размеры
0.9B – 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текстOllama2023–2025

Qwen-VL

Alibaba (команда Qwen) · Китай

Одна из сильнейших открытых моделей зрения: читает документы, таблицы, графики, видео, работает с интерфейсами. С Qwen3.5 зрение встроено прямо в основную модель Qwen.

  • Извлечение данных из сканов счетов и накладных
  • Разбор фотографий товаров и витрин
  • Анализ видео и записей с камер
Размеры
2B – 235B-A22B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCRGGUF2025

olmOCR

Ai2 (Allen Institute for AI) · США

Модель и набор инструментов для массового перевода PDF в чистый текст с сохранением порядка чтения, таблиц и формул. Рассчитана на обработку миллионов страниц.

  • Массовая оцифровка архива PDF
  • Распознавание договоров и отчётов в текст
  • Подготовка документов для поиска и RAG
Размеры
7B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Документы и OCRRUGGUF2025

Nanonets-OCR

Nanonets · США / Индия

Модель для перевода документов в Markdown с таблицами, печатями, подписями, галочками и водяными знаками. В карточке OCR2 русский указан среди языков.

  • Распознавание счетов, договоров и накладных, в том числе на русском
  • Распознавание печатей, подписей и отметок
  • Распознавание рукописного текста
Размеры
1.5B – 3B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Картинка + текстRU2025

A-Vision (Авито)

Авито Тех · Россия

Русскоязычная модель Авито, которая понимает картинки: описывает фото, отвечает на вопросы по изображению, читает надписи. Основа Qwen2.5-VL, на русском быстрее исходной.

  • Описание товара по фото на русском
  • Проверка, что фото совпадает с описанием
  • Чтение брендов и надписей на картинках
Размеры
7.4B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Документы и OCR2025

SmolDocling и Granite-Docling

IBM и Hugging Face · США

Крошечные модели для открытого конвертера документов Docling: переводят страницу в разметку с таблицами, формулами и кодом. Работают на обычном ноутбуке.

  • Перевод PDF и сканов в Markdown для поиска и RAG
  • Распознавание таблиц из отчётов
  • Разбор счетов и договоров на обычном ПК
Размеры
256M – 258M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Детекция подделок2022–2025

TruFor

GRIP, University Federico II of Naples · Италия

Ищет следы монтажа и показывает картой, какие участки изображения выглядят изменёнными: подходит для сканов договоров, справок и фото документов. Ошибается в обе стороны — решение принимает человек.

  • Проверка сканов справок и договоров на правку
  • Подсветка изменённых участков фото для эксперта
  • Отсев явно перерисованных документов до ручной проверки
Размеры
трансформерная модель с картой подозрительных областей
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Документы и OCR2024

GOT-OCR 2.0

StepFun · Китай

Одна из первых универсальных OCR-моделей нового поколения: текст, формулы, таблицы, ноты и схемы. Маленькая, работает на слабом железе, но уже уступает новинкам.

  • Распознавание сканов счетов и договоров
  • Перевод таблиц в редактируемый вид
  • Распознавание формул и схем
Размеры
580M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCRНе развивается2024

Kosmos-2.5

Microsoft · США

Превращает скан страницы в размеченный текст с координатами блоков или в markdown. Удобна как первый шаг перед разбором резюме. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.

  • Перевод сканов резюме в текст с сохранением структуры
  • Подготовка документов к извлечению полей
  • Оцифровка бумажных анкет
Размеры
около 1.4B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Документы и OCRНе развивается2024

UDOP

Microsoft · США

Одна модель на все задачи с документом: чтение, ответы на вопросы по странице, извлечение полей, классификация. В HR применяется для разбора резюме и приложенных сканов. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.

  • Извлечение полей из резюме и приложений к нему
  • Ответы на вопросы по содержимому документа
  • Классификация входящих документов
Размеры
742M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCRНе развивается2022–2023

Table Transformer

Microsoft · США

Небольшие модели, которые находят таблицы на страницах PDF и сканов и восстанавливают их структуру: строки, столбцы, заголовки. Текст внутри читает отдельный OCR.

  • Поиск таблиц в отчётах, выписках и счетах
  • Восстановление строк и столбцов для выгрузки в Excel
  • Подготовка табличных данных для анализа и RAG
Размеры
29M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCRНе развивается2023

Nougat

Meta · США

Ранняя модель, переводящая научные PDF в текст с формулами. Сегодня устарела, её обходят почти все современные OCR-модели.

  • Перевод научных статей из PDF в текст с формулами
  • Оцифровка технической документации
Размеры
250M – 350M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Картинка + текстНе развивается2023

Pix2Struct

Google · США

Читает документ или скриншот как картинку и отвечает структурой: текст, поля, ответы на вопросы. В HR её дообучают под резюме и анкеты. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.

  • Извлечение данных из резюме и анкет в виде картинок
  • Вопросы к содержимому скана
  • Разбор таблиц и схем в документах
Размеры
282M – 1.3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCRНе развивается2022

LiLT

SCUT DLVC Lab, Южно-Китайский технологический университет · Китай

Лёгкая модель, которая учитывает и текст, и расположение блоков на странице: обучается на одном языке и переносится на другие. Подходит для разметки полей резюме и анкет. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.

  • Разметка полей в резюме и анкетах
  • Извлечение данных из форм и бланков
  • Разбор документов на нескольких языках
Размеры
около 130M английская и около 280M многоязычная версия
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCRНе развивается2021–2022

TrOCR

Microsoft · США

Распознаёт одну строку текста, в том числе рукописного. Официальные веса только для английского, но модель часто дообучают под другие языки — есть русские версии от сообщества.

  • Распознавание рукописных строк в анкетах и бланках
  • Распознавание печатных строк после поиска текста на странице
  • Основа для дообучения под свой почерк или шрифт
Размеры
62M – 608M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Разбор текстаНе развивается2020–2022

LayoutLM (v1–v3, LayoutXLM)

Microsoft · США

Классические модели понимания документов: учитывают текст, его расположение на странице и картинку. Их дообучают под извлечение полей из форм и чеков. Коммерчески свободна только первая версия.

  • Извлечение полей из анкет, форм и чеков после дообучения
  • Классификация типов документов
  • Ответы на вопросы по отсканированной странице
Размеры
около 110M – 370M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Документы и OCRНе развивается2022

Donut

NAVER CLOVA · Южная Корея

Читает скан документа и сразу отдаёт заполненную структуру полей, без отдельного OCR. В HR её дообучают под разбор резюме и анкет. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.

  • Извлечение полей из анкет и резюме
  • Разбор сканов справок и дипломов
  • Определение типа входящего документа
Размеры
около 200M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Компьютерное зрениеНе развивается2022

DiT (Document Image Transformer)

Microsoft · США

По картинке определяет, что за документ перед ней: резюме, диплом, справка, договор. Помогает раскладывать пакеты файлов от кандидатов по типам. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.

  • Сортировка входящих документов кандидатов по типам
  • Проверка комплектности пакета документов
  • Поиск нужного скана в архиве
Размеры
версии base и large
Железо
от: Ноутбук
Коммерция с условиямиПодробнее

Подборки

Нужна модель под вашу задачу?

Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.

  1. ПодберуМодель и размер под задачу и бюджет на железо
  2. ПоставлюНа ваш сервер или в закрытый контур, с API
  3. ДообучуНа ваших данных или подключу базу знаний
  4. ВстроюВ CRM, 1С, бота, сайт или рабочий чат
Обсудить внедрение