Стек под документооборот: от скана до строки в базе
Счета, накладные, акты и договоры приходят в компанию пачками: часть в PDF, часть фотографией с телефона, часть сканом с перекосом. Одна модель тут не справляется, потому что задач на самом деле три: увидеть текст на картинке, понять смысл написанного и потом быстро найти нужный документ среди тысяч. Каждую из них лучше решает свой тип модели, поэтому связка из нескольких звеньев обходится дешевле и ошибается реже, чем попытка повесить всё на одну большую модель.
Скан или фотография для компьютера это просто набор точек. Модель распознавания документов переводит их в текст и, что важнее, сохраняет структуру: где шапка, где таблица, где подпись. Если выкинуть это звено, следующей модели придётся угадывать по обрывкам, и суммы из таблицы разъедутся по строкам. На бледных печатях и мятых листах именно качество распознавания определяет качество всего остального.
Крошечные модели для открытого конвертера документов Docling: переводят страницу в разметку с таблицами, формулами и кодом. Работают на обычном ноутбуке.
Многоязычная модель для разбора документов: текст, таблицы, формулы и порядок чтения за один проход. dots.mocr ещё переводит графики и схемы в векторный SVG.
Компактная модель для разбора документов из популярного набора PaddleOCR. По карточке поддерживает 109 языков, в том числе русский; версия 1.6 лидирует на тесте OmniDocBench.
Распознавание счетов, договоров и накладных, в том числе на русском
Распознавание таблиц, формул, печатей
Перевод сканов в Markdown и JSON
Размеры
0.9B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Шаг 2. Вытащить нужные поля
Текст сам по себе ещё не данные. На этом шаге языковая модель читает распознанный документ и раскладывает его по полям: контрагент, номер, дата, сумма, ставка налога, позиции. Она же понимает, что перед ней накладная, по смыслу документа, а не по слову в заголовке. Без этого звена сотрудник продолжает вбивать реквизиты руками, и весь выигрыш от распознавания теряется на перепечатке.
Европейские модели с упором на скорость. Mixtral — одна из первых открытых моделей на архитектуре «смесь экспертов»; есть версии с картинками (Pixtral, Medium 3.5), для доказательств в Lean и модерации (Shieldstral).
Компактные модели Google: хорошо работают на одном компьютере, старшие версии понимают картинки. Есть CodeGemma для кода, FunctionGemma 270M для вызова функций и быстрая DiffusionGemma.
Ассистент на ноутбуке без интернета
Разбор фото документов и чеков
Классификация обращений
Размеры
270M – 31B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Шаг 3. Собрать таблицы и проверить схему
Отдельная модель под таблицы и извлечение полей страхует предыдущий шаг: она собирает многострочные таблицы обратно в строки и достаёт значения по заданному списку полей. Это дешёвый способ поймать расхождение до того, как документ уйдёт в учётную систему. Если звена нет, ошибка всплывает позже, на сверке, когда исправлять её дороже и уже с участием бухгалтера.
Небольшие модели, которые находят таблицы на страницах PDF и сканов и восстанавливают их структуру: строки, столбцы, заголовки. Текст внутри читает отдельный OCR.
Поиск таблиц в отчётах, выписках и счетах
Восстановление строк и столбцов для выгрузки в Excel
Модели для извлечения данных по шаблону: даёте документ или скан и JSON-шаблон полей, получаете заполненный JSON. NuExtract3 (4B) заодно переводит сканы в Markdown.
Извлечение реквизитов, сумм и дат из счетов и договоров в JSON
Разбор чеков, накладных и анкет по заданному шаблону
Перевод сканов в Markdown для поиска
Размеры
0.5B – 8B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Шаг 4. Сделать архив ищущимся
Модель эмбеддингов превращает каждый документ в числовой отпечаток смысла, и поиск начинает находить по сути запроса, а не по точному совпадению слов. Сотрудник спрашивает про поставку щебня за прошлую весну и получает нужные акты, даже если внутри они названы иначе. Без этого шага архив остаётся папкой, в которой ищут глазами и по названию файла.
Сильные многоязычные эмбеддинги с длинным контекстом, v5-omni понимает текст, картинки и аудио. Свежие версии открыты только для некоммерческого использования.
Поиск по документам на многих языках
Поиск по картинкам и сканам
Классификация и кластеризация
Размеры
33M – 3.8B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
На что смотреть до внедрения
Чаще всего ломаются не модели, а вход: фото под углом, копия с копии, печать поверх цифр. До внедрения соберите сотню реальных документов худшего качества и прогоните связку на них, а не на образцовых PDF. Отдельно продумайте спорные случаи: нужен режим, в котором документ уходит человеку, а не молча записывается в базу. Персональные данные в документах, сроки хранения и допустимость обработки описаны здесь в общих чертах, конкретный случай смотрит юрист.
Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.
ПодберуМодель и размер под задачу и бюджет на железо
ПоставлюНа ваш сервер или в закрытый контур, с API