Docspell: архив сканов и писем на своём сервере
Docspell принимает сканы, письма и файлы, распознаёт текст и подсказывает корреспондента, дату и теги. Разбираю, чем он отличается от Paperless-ngx и DocJev, как у него с русским языком и 152-ФЗ, и почему стабильный релиз не выходил с марта 2025 года.
Стопка, которую никто не разбирает
В офисе есть папка «Сканы». Туда падают файлы со сканера, вложения из почты бухгалтера, фотографии актов из мессенджера. Названия вроде «scan_0417.pdf». Раз в месяц кто-то обещает всё разложить и не раскладывает. Через год нужен договор, и поиск занимает полдня. Прикидка, не измерение: двести файлов в месяц по минуте на то, чтобы открыть, понять и назвать, это больше трёх часов чужого времени. Docspell берёт на себя первичную разборку и подсказывает, куда документ положить.
Что умеет Docspell
Репозиторий: github.com/eikek/docspell, 2333 звезды, проект создан в 2019 году. В описании сказано, что он помогает разобрать стопки документов от сканеров, почты и других источников с минимумом усилий.
Файл загружается в веб-интерфейсе, через REST API или через адрес приёма, который привязывается к папке. Затем распознаётся текст, если он нужен, и документ попадает в полнотекстовый поиск. Система предлагает корреспондента, теги и даты. Обучение идёт на ваших же документах.
Отдельно сильна работа с почтой. В настройках можно добавить IMAP-ящики и периодические задачи, которые забирают письма и вложения в архив. Ящиков можно подключить несколько. Для общего доступа есть публичные ссылки на выборку документов, при желании с паролем. В README упомянуты Android-клиент для загрузки файлов с телефона и консольная утилита.
Жив ли проект
Скажу прямо. Последний стабильный релиз v0.43.0 вышел 15 марта 2025 года, то есть больше полутора лет назад. Раньше релизы выходили раз в семь-четырнадцать месяцев. Ночная сборка от 22 сентября 2026 года есть. В сентябре 2026 коммиты шли: чинили конвертацию офисных файлов через unoserver, а значительная часть остального приходится на ботов, обновляющих зависимости. С 1 июля 2026 слито 23 запроса на изменения. Репозиторий не архивный.
Основной автор один, ему помогают несколько разработчиков и боты. Открытых обращений и запросов около 238. Отвечают ли на них, я не проверял. Проект живой, но развивается медленно, и крупных новинок ждать не стоит.
Чем отличается от Paperless-ngx и DocJev
Про Paperless-ngx я писал отдельно: электронный архив документов. Задача у систем общая, поэтому выбирать нужно по деталям. Docspell заточен под забор почты из нескольких ящиков, раздельные группы пользователей и обмен ссылками. Подсказки метаданных у него строятся на машинном обучении по вашему архиву, а для английского, немецкого, французского и испанского ещё и на готовых языковых моделях.
Ещё один инструмент из блога, DocJev, режет склеенные PDF и раскладывает по категориям, но решение принимает облачная модель, и текст страниц уходит наружу. Архива у него нет, это заготовка. Docspell хранит документы у вас, и распознавание с подсказками работает на вашем сервере.
Когда брать Docspell: нужен забор почты с нескольких ящиков, документы на английском, немецком или французском, устраивает англоязычный интерфейс у сотрудников. Когда Paperless-ngx: основной язык русский, сотрудникам нужен привычный интерфейс, важны свежие релизы. Совпадения по отдельным возможностям перед выбором проверьте по документации обоих проектов, я сверял только Docspell.
Русский язык, сервер и 152-ФЗ
Русский входит в список языков документов Docspell, код rus. Распознаёт текст Tesseract, языковой пакет ставится отдельно. Модели для распознавания имён и организаций, по документации, есть для немецкого, английского, французского и испанского. Для остальных языков, включая русский, работают правила по вашей адресной книге и классификатор, который учится на загруженных документах. Подсказки, скорее всего, будут хуже, чем на английском, и в первые недели придётся поправлять руками.
Интерфейс переведён на английский, немецкий и французский. Русского нет.
Сканы часто содержат персональные данные. Часть 5 статьи 18 закона 152-ФЗ запрещает запись, накопление и хранение персональных данных граждан РФ в базах за пределами России, кроме случаев, указанных в пунктах 2, 3, 4 и 8 части 1 статьи 6. Текст: статья 18 на consultant.ru. Сервер в России с Docspell на нём это требование для хранения сканов закрывает. Остальные обязанности оператора, например уведомление РКН и защита, нужно закрывать отдельно.
Что важно учесть
Для запуска нужна Java: документация проверяла на JDK 17, в официальных образах тоже 17. Обработчик файлов использует Ghostscript, Tesseract, unpaper, unoserver с LibreOffice и wkhtmltopdf. Для подсказок по полному режиму документация советует выделить обработчику не меньше 1,4 ГБ памяти, для упрощённого около 500 МБ. На сервер закладывайте с запасом.
Установка через Docker Compose описана тремя командами в README. На Docker Hub самый свежий тег с номером версии, который я увидел, v0.42.0, перед установкой проверьте, какую версию вы получите. Мобильное приложение и консольная утилита живут в отдельных репозиториях, их состояние я не смотрел.
Главный риск общий для небольшого проекта с одним автором: если он остановится, поддерживать систему придётся вам или подрядчику. Поэтому архив нужно держать в обычных файлах и делать резервные копии.
Что можно сделать уже сейчас
- Возьмите сотню своих сканов, пять типов документов, и прогоните через демо на тестовом сервере, чтобы увидеть, как проходит русское распознавание.
- Заведите один рабочий ящик, например «Счета от поставщиков», и подключите его периодической задачей.
- Заполните адресную книгу контрагентами, на ней держатся подсказки для русских документов.
- Если сомневаетесь, поставьте рядом Paperless-ngx на те же сто файлов и сравните.
Частые вопросы
Можно ли пользоваться, если релизов давно нет?
Код обновляется, ночные сборки выходят. Но стабильный релиз давно не выходил, поэтому для рабочего архива нужен план обновлений и копий.
Заменит ли Docspell 1С или систему электронного документооборота?
Нет. Это архив с поиском и подсказками. Подписи и маршруты согласования он не ведёт. Про разбор накладных поставщиков в 1С я писал в статье про распознавание накладных.
Нужен ли свой сервер?
Да, система ставится на ваше оборудование или арендованный сервер в России. Размер машины зависит от режима подсказок и объёма архива, его подбирают после теста на ваших файлах.
Коротко о главном
Docspell подходит, когда поток писем и сканов нужно разбирать автоматически и хранить у себя. Он работает на русских сканах, но без русского интерфейса и с более слабыми подсказками имён. Стабильный релиз давно не выходил, и это надо учитывать при выборе.
Мы разворачиваем и настраиваем разбор под ваши документы: автоматизация бизнеса. Покажем на ваших сканах, что получится, и скажем честно, нужен ли вам Docspell или лучше другая система. Напишите в Telegram кодовое слово «СКАНЫ».
Ещё open-source для бизнеса
Эта статья — часть каталога бесплатных решений, которые я разворачиваю на вашем сервере под ключ: CRM, аналитика, документы, почта, безопасность, магазины, AI.
Что я делаю для бизнеса
- Боты в Telegram, MAX, VK
- Автоматизация процессов и CRM
- Аналитика и дашборды
- Сайты и лендинги под ключ
Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»
12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.
Готовы обсудить вашу задачу?
Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.
Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.


