Разбор текстаДокументы и OCR

NuExtract

Модели для извлечения данных по шаблону: даёте документ или скан и JSON-шаблон полей, получаете заполненный JSON. NuExtract3 (4B) заодно переводит сканы в Markdown.

Разработчик
NuMind, Франция
Первый выпуск
май 2024
Последний выпуск
апр 2026
Размеры
0.5B – 8B
Лицензия
Можно в коммерциюNuExtract 1.x и 2.0 (2B, 8B) — MIT, NuExtract3 — Apache 2.0; исключение: NuExtract-2.0-4B под исследовательской лицензией Qwen
Русский язык
Не заявлен
Запуск
Есть в OllamaРаботает и без видеокарты
Сферы
Документы и бухгалтерия, Финансы, Юристы, Торговля и маркетплейсы

Какие задачи решает

  • Извлечение реквизитов, сумм и дат из счетов и договоров в JSON
  • Разбор чеков, накладных и анкет по заданному шаблону
  • Перевод сканов в Markdown для поиска
  • Заполнение карточек CRM и учётных систем из писем

Где применяется

Бухгалтерия и документооборотЮридические отделыЛогистика и закупкиБанки и страхование

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходит
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. NuExtract3 (4B)
  2. NuExtract 2.0 (2B, 4B, 8B, работает с картинками)
  3. NuExtract 1.5 (многоязычная)
  4. NuExtract-large
  5. NuExtract, NuExtract-tiny

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели