Стек под документооборот: от скана до строки в базе

Счета, накладные, акты и договоры приходят в компанию пачками: часть в PDF, часть фотографией с телефона, часть сканом с перекосом. Одна модель тут не справляется, потому что задач на самом деле три: увидеть текст на картинке, понять смысл написанного и потом быстро найти нужный документ среди тысяч. Каждую из них лучше решает свой тип модели, поэтому связка из нескольких звеньев обходится дешевле и ошибается реже, чем попытка повесить всё на одну большую модель.

Шаг 1. Превратить картинку в текст

Скан или фотография для компьютера это просто набор точек. Модель распознавания документов переводит их в текст и, что важнее, сохраняет структуру: где шапка, где таблица, где подпись. Если выкинуть это звено, следующей модели придётся угадывать по обрывкам, и суммы из таблицы разъедутся по строкам. На бледных печатях и мятых листах именно качество распознавания определяет качество всего остального.

Чем это делается

Документы и OCR2025

SmolDocling и Granite-Docling

IBM и Hugging Face · США

Крошечные модели для открытого конвертера документов Docling: переводят страницу в разметку с таблицами, формулами и кодом. Работают на обычном ноутбуке.

  • Перевод PDF и сканов в Markdown для поиска и RAG
  • Распознавание таблиц из отчётов
  • Разбор счетов и договоров на обычном ПК
Размеры
256M – 258M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCRRUGGUF2025–2026

dots.ocr

rednote hilab (Xiaohongshu) · Китай

Многоязычная модель для разбора документов: текст, таблицы, формулы и порядок чтения за один проход. dots.mocr ещё переводит графики и схемы в векторный SVG.

  • Распознавание счетов, договоров и накладных
  • Перевод таблиц в редактируемый вид
  • Перевод графиков и схем в векторный формат
Размеры
около 3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCRRUGGUF2025–2026

PaddleOCR-VL

Baidu (PaddlePaddle) · Китай

Компактная модель для разбора документов из популярного набора PaddleOCR. По карточке поддерживает 109 языков, в том числе русский; версия 1.6 лидирует на тесте OmniDocBench.

  • Распознавание счетов, договоров и накладных, в том числе на русском
  • Распознавание таблиц, формул, печатей
  • Перевод сканов в Markdown и JSON
Размеры
0.9B
Железо
от: Ноутбук
Можно в коммерциюПодробнее

Шаг 2. Вытащить нужные поля

Текст сам по себе ещё не данные. На этом шаге языковая модель читает распознанный документ и раскладывает его по полям: контрагент, номер, дата, сумма, ставка налога, позиции. Она же понимает, что перед ней накладная, по смыслу документа, а не по слову в заголовке. Без этого звена сотрудник продолжает вбивать реквизиты руками, и весь выигрыш от распознавания теряется на перепечатке.

Чем это делается

ТекстRUOllama2023–2026

Qwen

Alibaba · Китай

Семейство языковых моделей с сильным русским языком: от маленьких версий для ноутбука до флагмана уровня коммерческих API.

  • Чат-бот и ассистент по базе знаний
  • Ответы на письма и обращения
  • Разбор и классификация документов
Размеры
0,6B – 2,4T-A95B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
ТекстRUOllama2023–2026

Mistral

Mistral AI · Франция

Европейские модели с упором на скорость. Mixtral — одна из первых открытых моделей на архитектуре «смесь экспертов»; есть версии с картинками (Pixtral, Medium 3.5), для доказательств в Lean и модерации (Shieldstral).

  • Быстрые ответы в чате
  • Извлечение данных из текста
  • Перевод и работа с несколькими языками
Размеры
3B – 675B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
ТекстOllama2024–2026

Gemma

Google · США

Компактные модели Google: хорошо работают на одном компьютере, старшие версии понимают картинки. Есть CodeGemma для кода, FunctionGemma 270M для вызова функций и быстрая DiffusionGemma.

  • Ассистент на ноутбуке без интернета
  • Разбор фото документов и чеков
  • Классификация обращений
Размеры
270M – 31B
Железо
от: Ноутбук
Можно в коммерциюПодробнее

Шаг 3. Собрать таблицы и проверить схему

Отдельная модель под таблицы и извлечение полей страхует предыдущий шаг: она собирает многострочные таблицы обратно в строки и достаёт значения по заданному списку полей. Это дешёвый способ поймать расхождение до того, как документ уйдёт в учётную систему. Если звена нет, ошибка всплывает позже, на сверке, когда исправлять её дороже и уже с участием бухгалтера.

Чем это делается

Документы и OCRНе развивается2022–2023

Table Transformer

Microsoft · США

Небольшие модели, которые находят таблицы на страницах PDF и сканов и восстанавливают их структуру: строки, столбцы, заголовки. Текст внутри читает отдельный OCR.

  • Поиск таблиц в отчётах, выписках и счетах
  • Восстановление строк и столбцов для выгрузки в Excel
  • Подготовка табличных данных для анализа и RAG
Размеры
29M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Разбор текстаOllama2024–2026

NuExtract

NuMind · Франция

Модели для извлечения данных по шаблону: даёте документ или скан и JSON-шаблон полей, получаете заполненный JSON. NuExtract3 (4B) заодно переводит сканы в Markdown.

  • Извлечение реквизитов, сумм и дат из счетов и договоров в JSON
  • Разбор чеков, накладных и анкет по заданному шаблону
  • Перевод сканов в Markdown для поиска
Размеры
0.5B – 8B
Железо
от: Ноутбук
Можно в коммерциюПодробнее

Шаг 4. Сделать архив ищущимся

Модель эмбеддингов превращает каждый документ в числовой отпечаток смысла, и поиск начинает находить по сути запроса, а не по точному совпадению слов. Сотрудник спрашивает про поставку щебня за прошлую весну и получает нужные акты, даже если внутри они названы иначе. Без этого шага архив остаётся папкой, в которой ищут глазами и по названию файла.

Чем это делается

Поиск и RAGRUOllamaНе развивается2024

BGE-M3

BAAI · Китай

Модель для поиска по смыслу на сотне языков. Основа RAG: бот находит нужный кусок документа перед ответом.

  • Поиск по базе документов
  • RAG для чат-бота
  • Поиск похожих обращений и дублей
Размеры
568M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Поиск и RAGRUНе развивается2022–2024

E5 / multilingual-e5

Microsoft · США

Проверенные модели для смыслового поиска. Многоязычные версии хорошо работают с русским и до сих пор служат надёжной основой для RAG.

  • Поиск по базе знаний и документам
  • Подбор ответов для чат-бота (RAG)
  • Поиск похожих обращений и дублей
Размеры
33M – 7B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Поиск и RAGRUGGUF2023–2026

Jina Embeddings

Jina AI · Германия

Сильные многоязычные эмбеддинги с длинным контекстом, v5-omni понимает текст, картинки и аудио. Свежие версии открыты только для некоммерческого использования.

  • Поиск по документам на многих языках
  • Поиск по картинкам и сканам
  • Классификация и кластеризация
Размеры
33M – 3.8B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее

На что смотреть до внедрения

Чаще всего ломаются не модели, а вход: фото под углом, копия с копии, печать поверх цифр. До внедрения соберите сотню реальных документов худшего качества и прогоните связку на них, а не на образцовых PDF. Отдельно продумайте спорные случаи: нужен режим, в котором документ уходит человеку, а не молча записывается в базу. Персональные данные в документах, сроки хранения и допустимость обработки описаны здесь в общих чертах, конкретный случай смотрит юрист.

Другие стеки

Нужна модель под вашу задачу?

Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.

  1. ПодберуМодель и размер под задачу и бюджет на железо
  2. ПоставлюНа ваш сервер или в закрытый контур, с API
  3. ДообучуНа ваших данных или подключу базу знаний
  4. ВстроюВ CRM, 1С, бота, сайт или рабочий чат
Обсудить внедрение