Сканы в один PDF с поиском: склейка, разбивка, сжатие и распознавание пачкой
Архив сканов без поиска бесполезен. Разбираю, как обработать тысячи файлов разом и почему документы с персональными данными нельзя отдавать в чужие онлайн-сервисы.
Коротко (TL;DR)
- Пачки сканов договоров, актов и архивных бумаг можно разом склеить в PDF по папкам, распознать текст и сделать документы доступными для поиска.
- Большой скан на сотни страниц скрипт делит на отдельные документы, сжимает для отправки по почте и называет файлы по одному правилу.
- Документы с персональными данными не стоит загружать в чужие онлайн-сервисы. Обработку лучше вести на своём компьютере или сервере.
В каждом офисе есть такая папка. Сотни сканов по одной странице, названные как придётся. Договор на двенадцать листов лежит двенадцатью файлами. Акты за год отсканированы одним файлом на триста страниц, который не открывается на телефоне и не лезет в письмо. Найти в этом нужный документ можно только глазами. Я разбираю такие архивы пачкой: склеиваю, делю, сжимаю и распознаю. Расскажу, как это работает и что нужно от вас.
Почему сканы превращаются в хаос
Сканер сохраняет то, что ему дали, и называет файлы по-своему. Кто-то сканирует по листу, кто-то всю стопку сразу. Один сотрудник пишет в имени дату, другой номер договора, третий ничего не пишет.
Через год в папке тысячи файлов. Они весят много, в них нет текста, их нельзя найти поиском. Сканы — это просто картинки страниц. Компьютер не знает, что внутри написано слово «аренда» или номер счёта.
Руками навести порядок можно, но это недели монотонной работы. Открыть, посмотреть, переименовать, склеить, сжать. Такую работу лучше отдать скрипту, а человеку оставить проверку.
Склейка и разбивка
Склейка — самый простой случай. Если листы одного документа лежат в одной папке, скрипт собирает их в один PDF в правильном порядке. Порядок берётся из имён файлов или из времени сканирования.
Обратная задача сложнее. Большой скан на сотни страниц нужно разделить на отдельные документы. Скрипт ищет границы: пустые страницы-разделители, штрихкоды, первую страницу с заголовком «Договор» или «Акт». Если при сканировании вставлять лист-разделитель, разбивка получается почти без ошибок.
Там, где граница неочевидна, скрипт помечает место для проверки. Человек смотрит и подтверждает, где кончается один документ и начинается другой.
Распознавание текста для поиска
Распознавание переводит картинку страницы в текст. Этот текст кладётся в PDF невидимым слоем под изображением. Внешне документ не меняется, но в нём работает поиск, а текст можно выделить и скопировать.
После этого вся папка становится доступной для поиска. Ищете номер договора или название контрагента — и находите нужный файл. Это главная польза всей работы.
Качество зависит от скана. Чёткий печатный текст распознаётся хорошо. Бледные копии, рукописные пометки, печати поверх текста дают ошибки. Если нужно вытащить данные из бланков в таблицу, это уже отдельная задача. Про неё я писал в статье оцифровка бумажных анкет и бланков.
Сжатие и единые имена файлов
Сканы часто весят в разы больше, чем нужно. Скрипт сжимает изображения внутри PDF так, чтобы текст оставался читаемым. Файл, который не пролезал в письмо, начинает пролезать.
Имена файлов приводятся к одному правилу. Например: тип документа, дата, контрагент, номер. Часть этих данных скрипт может взять из распознанного текста, часть из названия папки. Где данных не хватает, имя помечается для проверки.
Правило имени договариваем заранее. Оно должно быть удобно вашим сотрудникам, а не мне. Вместе с именами можно поменять и структуру папок. Например, год, внутри контрагент, внутри типы документов. Тогда нужный файл находится даже без поиска, просто по дереву папок.
Задачи, способы и результат
| Задача | Как делаем | Результат |
|---|---|---|
| Склеить листы в документы | Сборка по папкам и порядку файлов | Один PDF на один документ |
| Разделить большой скан | Поиск разделителей и первых страниц | Отдельные файлы по документам |
| Сделать поиск по архиву | Распознавание и невидимый текстовый слой | Документы находятся по словам и номерам |
| Уменьшить размер | Сжатие изображений с сохранением читаемости | Файлы проходят в почту и открываются на телефоне |
| Навести порядок в именах | Имя по правилу из текста и папок | Единообразные названия и сортировка |
| Повернуть и выровнять | Автоповорот и выпрямление страниц | Страницы читаются без поворота головы |
Почему не в онлайн-сервис
Для одного файла онлайн-сервисы удобны. Но договоры, акты и кадровые документы содержат паспортные данные, адреса, суммы, подписи. Загружать тысячи таких файлов на чужой сервер — плохая идея. Вы не знаете, где они хранятся и кто их увидит.
Поэтому я делаю обработку на вашем компьютере или сервере. Все инструменты работают локально, документы никуда не уходят. Если нужен удобный набор PDF-инструментов в браузере для сотрудников, его тоже можно развернуть у себя. Об этом статья инструменты для PDF на своём сервере.
Как это выглядит, когда настроено
У вас была папка с тысячами сканов. После обработки в ней порядок. Документы разложены по годам и контрагентам. Каждый договор — один файл с понятным именем.
Бухгалтеру нужен акт по конкретному контрагенту. Он вводит название в поиск по папке и сразу видит нужные файлы. Открывает, копирует номер и сумму прямо из PDF.
Руководитель просит переслать договор партнёру. Файл весит немного и уходит обычным письмом. Отдельно лежит короткий список документов, где скрипт засомневался. Сотрудник проверил их за час, а не разбирал весь архив неделями.
Как заказать такую задачу
Пришлите несколько типичных сканов и опишите архив: сколько примерно файлов, как они разложены, что хотите получить. Если документы с персональными данными, можно прислать обезличенные примеры или показать структуру папок без содержимого.
Я смотрю качество сканов и предлагаю правило имён и структуру папок. Даю оценку. Настраиваю обработку на вашей машине или сервере, прогоняю пробную часть, сверяем с вами. Потом обрабатываю весь архив. Передаю результат, список документов на проверку, инструкцию, как обрабатывать новые сканы, и доступы. После сдачи есть гарантийный срок на исправление ошибок в моей работе.
Если нужно разово разобрать накопленный архив, это разовая задача. Если сканы приходят каждый день и их нужно постоянно обрабатывать, удобнее абонентка. Формат разовых работ на странице разовые задачи: скрипты, парсеры, выгрузки.
Частые вопросы
Изменится ли внешний вид документа после распознавания?
Нет. Скан остаётся картинкой, а текст лежит невидимым слоем под ней.
Распознаётся ли рукописный текст?
Плохо и с ошибками. Для поиска надёжнее опираться на печатные части документа.
Можно ли обрабатывать новые сканы автоматически?
Да. Скрипт следит за папкой и обрабатывает всё, что туда попадает.
Что если сжатие испортит мелкий текст?
Степень сжатия подбирается на пробной партии. Если мелкий шрифт страдает, сжимаем слабее.
Сохранятся ли исходные сканы?
Да. Исходники не меняются, обработка идёт в копии до вашего подтверждения.
Коротко о главном
Архив сканов можно разобрать пачкой. Листы склеиваются в документы, большие файлы делятся, страницы распознаются, а файлы сжимаются и получают единые имена.
Главная польза — поиск по всему архиву. Документы с персональными данными обрабатываются на вашем компьютере или сервере, а спорные места проверяет человек.
Если у вас есть папка сканов, в которой ничего нельзя найти, пришлите несколько файлов и опишите архив. Скажу, как его разобрать. Напишите в Telegram, MAX или VK.
Небольшие задачи без большого проекта
- Парсеры, сверки и выгрузки в таблицы
- Скрипты, генераторы документов, обработка файлов
- Простые боты и напоминания в мессенджер
- Абонентка: мониторинг, поддержка, отчёты
Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»
12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.
Готовы обсудить вашу задачу?
Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.
Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.


