DiT (Document Image Transformer)
По картинке определяет, что за документ перед ней: резюме, диплом, справка, договор. Помогает раскладывать пакеты файлов от кандидатов по типам. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.
Последняя открытая версия вышла в мар 2022. Семейство давно не обновлялось: это не значит, что модель не работает, но свежих исправлений и новых размеров ждать не стоит.
- Разработчик
- Microsoft, США
- Первый выпуск
- мар 2022
- Последний выпуск
- мар 2022
- Размеры
- версии base и large
- Лицензия
- Коммерция с условиямиMIT по репозиторию microsoft/unilm; на карточках Hugging Face лицензия не указана
- Запуск
- Через свой серверРаботает и без видеокарты
- Сферы
- Документы и бухгалтерия, HR
Какие задачи решает
- Сортировка входящих документов кандидатов по типам
- Проверка комплектности пакета документов
- Поиск нужного скана в архиве
Где применяется
Требования к железу
Версии
- DiT, дообученная на RVL-CDIP, 16 типов документов
- DiT-base и DiT-large
Как запустить
Ставлю и настраиваю под ключ: подберу размер модели, разверну на вашем сервере, подключу к вашим системам.
Частые вопросы
Можно ли использовать DiT (Document Image Transformer) в коммерческом проекте?
С условиями. Лицензия: MIT по репозиторию microsoft/unilm; на карточках Hugging Face лицензия не указана. Ограничения бывают разными — регион, выручка компании, требование указывать авторство. Перед коммерческим запуском проверьте условия с юристом.
Какое железо нужно для DiT (Document Image Transformer)?
Минимум: Ноутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии. Есть версии, которые работают и без видеокарты, на обычном процессоре. Точный объём видеопамяти под ваш размер модели и контекст можно посчитать в калькуляторе железа.
Поддерживает ли DiT (Document Image Transformer) русский язык?
Для этой модели язык не важен: она работает не с текстом.
Где скачать DiT (Document Image Transformer) и сколько это стоит?
Веса DiT (Document Image Transformer) лежат в открытом доступе и скачиваются бесплатно. Платить нужно только за железо, на котором модель работает, и за настройку. Ссылки на первоисточник — в конце страницы.
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Читает скан документа и сразу отдаёт заполненную структуру полей, без отдельного OCR. В HR её дообучают под разбор резюме и анкет. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.
ПодробнееРазбор текстаLayoutLM (v1–v3, LayoutXLM)Microsoft · СШАКоммерция с условиямиКлассические модели понимания документов: учитывают текст, его расположение на странице и картинку. Их дообучают под извлечение полей из форм и чеков. Коммерчески свободна только первая версия.
ПодробнееДокументы и OCRSmolDocling и Granite-DoclingIBM и Hugging Face · СШАМожно в коммерциюКрошечные модели для открытого конвертера документов Docling: переводят страницу в разметку с таблицами, формулами и кодом. Работают на обычном ноутбуке.
ПодробнееИсточник: huggingface.co/microsoft/dit-base. Данные сверены с карточкой модели 22.09.2026. Лицензию перед коммерческим запуском проверьте с юристом.


