Разбор текстаДокументы и OCR

LayoutLM (v1–v3, LayoutXLM)

Классические модели понимания документов: учитывают текст, его расположение на странице и картинку. Их дообучают под извлечение полей из форм и чеков. Коммерчески свободна только первая версия.

Разработчик
Microsoft, США
Первый выпуск
фев 2020
Последний выпуск
июл 2022
Размеры
около 110M – 370M
Лицензия
Коммерция с условиямиLayoutLM v1 — MIT; LayoutLMv2, LayoutXLM и LayoutLMv3 — CC BY-NC-SA 4.0 (некоммерческие)
Русский язык
Нет
Запуск
Через свой серверРаботает и без видеокарты
Сферы
Документы и бухгалтерия, Финансы, Юристы

Какие задачи решает

  • Извлечение полей из анкет, форм и чеков после дообучения
  • Классификация типов документов
  • Ответы на вопросы по отсканированной странице

Где применяется

ДокументооборотСтрахование и банкиИсследования

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версий
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. LayoutLMv3 для китайского
  2. LayoutLMv3
  3. LayoutLM cased
  4. LayoutXLM (многоязычная)
  5. LayoutLMv2
  6. LayoutLM

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели