Pix2Struct
Читает документ или скриншот как картинку и отвечает структурой: текст, поля, ответы на вопросы. В HR её дообучают под резюме и анкеты. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.
Последняя открытая версия вышла в мар 2023. Семейство давно не обновлялось: это не значит, что модель не работает, но свежих исправлений и новых размеров ждать не стоит.
- Разработчик
- Google, США
- Первый выпуск
- мар 2023
- Последний выпуск
- мар 2023
- Размеры
- 282M – 1.3B
- Лицензия
- Можно в коммерциюApache 2.0
- Русский язык
- Нет
- Запуск
- Через свой серверРаботает и без видеокарты
- Сферы
- Документы и бухгалтерия, HR, Финансы
Какие задачи решает
- Извлечение данных из резюме и анкет в виде картинок
- Вопросы к содержимому скана
- Разбор таблиц и схем в документах
Где применяется
Требования к железу
Версии
- pix2struct-chartqa и ai2d, графики и схемы
- pix2struct-docvqa, вопросы к документу
- pix2struct-base и pix2struct-large
Как запустить
Ставлю и настраиваю под ключ: подберу размер модели, разверну на вашем сервере, подключу к вашим системам.
Частые вопросы
Можно ли использовать Pix2Struct в коммерческом проекте?
Да. Лицензия: Apache 2.0. Это разрешает коммерческое использование, но перед запуском лицензию всё равно стоит показать юристу.
Какое железо нужно для Pix2Struct?
Минимум: Ноутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии. Есть версии, которые работают и без видеокарты, на обычном процессоре. Точный объём видеопамяти под ваш размер модели и контекст можно посчитать в калькуляторе железа.
Поддерживает ли Pix2Struct русский язык?
Нет. В документации разработчика языки перечислены, русского среди них нет. Для русских задач лучше взять модель из подборки «Открытые ИИ-модели с русским языком».
Где скачать Pix2Struct и сколько это стоит?
Веса Pix2Struct лежат в открытом доступе и скачиваются бесплатно. Платить нужно только за железо, на котором модель работает, и за настройку. Ссылки на первоисточник — в конце страницы.
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Читает скан документа и сразу отдаёт заполненную структуру полей, без отдельного OCR. В HR её дообучают под разбор резюме и анкет. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.
ПодробнееДокументы и OCRUDOPMicrosoft · СШАМожно в коммерциюОдна модель на все задачи с документом: чтение, ответы на вопросы по странице, извлечение полей, классификация. В HR применяется для разбора резюме и приложенных сканов. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.
ПодробнееРазбор текстаNuExtractNuMind · ФранцияМожно в коммерциюМодели для извлечения данных по шаблону: даёте документ или скан и JSON-шаблон полей, получаете заполненный JSON. NuExtract3 (4B) заодно переводит сканы в Markdown.
ПодробнееИсточник: huggingface.co/google/pix2struct-base. Данные сверены с карточкой модели 22.09.2026. Лицензию перед коммерческим запуском проверьте с юристом.


