Сервис OCR и расшифровки аудио: кейс распознавания без облака
Компании нужно было превращать поток сканов и аудиозаписей в текст, но данные нельзя было отправлять в чужое облако. Разбираю кейс сервиса, который распознаёт документы и расшифровывает аудио прямо на своём сервере.
OCR и транскрибация — задачи, где выгода очевидна, но всё упирается в один вопрос: куда уходят данные. Ниже разбираю обезличенный кейс по типу задачи: без имён, цифр и названий. Клиент — компания с постоянным потоком бумаг и записей, для которой отправлять их в облако было нельзя. Если у вас похожая ситуация, логика решения переносится один в один.
С чем пришёл клиент
Каждый день у клиента копился поток входящих материалов в двух форматах. Первый — документы: сканы, фотографии с телефона, PDF, часть с печатями и подписями. Второй — аудио: записи звонков, диктофонные заметки, встречи и переговоры. И то и другое нужно было превращать в текст и структурированные данные, чтобы искать, хранить и обрабатывать.
Вручную это тонны монотонной работы: сотрудник перепечатывает документ или переслушивает запись и набирает расшифровку. Долго, дорого и с ошибками от усталости. Казалось бы, есть облачные сервисы, которые делают это за минуты. Но именно они клиенту и не подходили.
Данные были чувствительными: персональные данные под 152-ФЗ и коммерческая тайна. Отправить их в чужой облачный сервис — значит вынести за периметр компании то, что по требованиям и по здравому смыслу оттуда выносить нельзя. Нужна была обработка, которая физически не покидает сервер клиента.
Что я сделал
Я собрал единый сервис на сервере клиента, где обе задачи закрыты в одном месте, а данные никуда не уходят. Внутри два модуля.
Модуль OCR принимает скан, фото или PDF и вытаскивает из него текст, а где нужно — конкретные поля: даты, номера, суммы, реквизиты. То есть на выходе не просто «стена текста», а данные, которые можно разложить по таблице и выгрузить. Современные open-source OCR-модели уверенно работают с печатным текстом и сложной вёрсткой прямо на своём железе — про них я подробнее писал в разборе новых OCR-моделей для документов без облака и модели Chandra для документов. Общий принцип распознавания текста с изображений я разбирал и в материале про распознавание текста с фото.
Модуль транскрибации берёт аудио и превращает его в текст. Там, где нужно, — с разбивкой по говорящим: видно, кто что сказал, что критично для расшифровки звонков и переговоров. Как устроена такая расшифровка речи с разметкой спикеров, я показывал в разборе транскрибации речи через WhisperX.
Главное во всей схеме — она работает на open-source моделях на сервере клиента. Файл загружается, обрабатывается и результат отдаётся в удобном виде — текст, таблица, выгрузка — не покидая периметр компании. Никаких внешних API, никакой отправки данных наружу.
Что изменилось
Качественно эффект такой. Документы и записи, которые раньше лежали мёртвым грузом или требовали ручной перепечатки, стали искомым текстом и данными. Скан превращается в поля, звонок — в расшифровку с репликами по спикерам.
Ручной ввод почти ушёл. Сотрудник больше не перепечатывает и не переслушивает — он проверяет и правит готовый результат, а это принципиально быстрее. Точных процентов я здесь не называю осознанно: это обезличенный кейс, и честнее говорить про направление эффекта, чем про придуманную статистику.
И самое важное для клиента — данные остались в периметре компании. Требования по 152-ФЗ и коммерческой тайне соблюдены не на бумаге, а физически: обработка идёт на своём сервере, наружу не уходит ничего.
Кому подойдёт такое же
Решение ложится на любой бизнес, где есть поток документов и аудио плюс требования к приватности данных:
- бухгалтерии и юротделы — сканы, договоры, первичка, входящие документы;
- колл-центры и отделы продаж — расшифровка и анализ звонков;
- медиа, исследователи, HR — интервью, встречи, диктофонные записи;
- любая компания с потоком бумаг и аудио, которой нельзя выносить данные в чужое облако.
Чем плотнее поток и чувствительнее данные, тем заметнее выигрыш от локальной обработки.
Частые вопросы
Насколько точно сервис распознаёт текст? На печатных документах и чистом аудио современные open-source модели дают высокое качество, близкое к облачным сервисам. Финальную сверку всё равно делает человек — сервис снимает рутину, а не ответственность.
Работает ли с рукописью? С аккуратным рукописным текстом — частично, с печатным и типовыми бланками — уверенно. Рукопись всегда сложнее, поэтому на таких документах закладываем обязательную проверку оператором.
Уходят ли данные в облако? Нет. В этом весь смысл решения: и OCR, и транскрибация работают на сервере клиента, файлы не отправляются во внешние сервисы. Данные не покидают периметр компании.
Какие языки поддерживаются? И для OCR, и для транскрибации доступны русский, английский и ряд других языков — конкретный набор подбираем под задачу под нужные модели.
Коротко о главном
Клиенту нужно было превращать поток сканов, фото и аудиозаписей в текст и данные, но отдавать их в чужое облако было нельзя из-за 152-ФЗ и коммерческой тайны. Я собрал единый сервис на его сервере: модуль OCR вытаскивает текст и поля из документов, модуль транскрибации расшифровывает аудио с разбивкой по говорящим, а результат отдаётся текстом, таблицей или выгрузкой.
Результат качественный, но однозначный: документы и записи стали искомым текстом, ручной ввод почти ушёл, а данные остались внутри компании. Если у вас копится поток бумаг и аудио, а облако — не вариант, расскажите про свои документы и записи, и я предложу решение под ваш сервер.
Что я делаю под ключ
- Сайты, сервисы и админки под вашу задачу
- Интеграции с внешними API и данными
- Автоматизация рутины без облака
- Хостинг, домен, поддержка
Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»
12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.
Готовы обсудить вашу задачу?
Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.
Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.


