Компьютерное зрение

ViTPose

Простая и точная модель определения позы человека по ключевым точкам. Версия ViTPose++ умеет позы людей, животных и всего тела; встроена в библиотеку Transformers.

Разработчик
Сиднейский университет и JD Explore Academy, Австралия / Китай
Первый выпуск
май 2022
Последний выпуск
янв 2025
Размеры
33M – около 1B
Лицензия
Можно в коммерциюApache 2.0
Запуск
Через свой серверРаботает и без видеокарты
Сферы
Производство и склад, Медиа и продакшн, Медицина

Какие задачи решает

  • Ключевые точки тела на фото и видео
  • Анализ движений в спорте и реабилитации
  • Контроль рабочих поз и техники безопасности
  • Подготовка скелета для анимации

Где применяется

Спорт и фитнесПроизводство и охрана трудаВидеопродакшн

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходит
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. ViTPose / ViTPose++ в Transformers
  2. ViTPose++
  3. ViTPose

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели