Компьютерное зрение
ViTPose
Простая и точная модель определения позы человека по ключевым точкам. Версия ViTPose++ умеет позы людей, животных и всего тела; встроена в библиотеку Transformers.
- Разработчик
- Сиднейский университет и JD Explore Academy, Австралия / Китай
- Первый выпуск
- май 2022
- Последний выпуск
- янв 2025
- Размеры
- 33M – около 1B
- Лицензия
- Можно в коммерциюApache 2.0
- Запуск
- Через свой серверРаботает и без видеокарты
- Сферы
- Производство и склад, Медиа и продакшн, Медицина
Какие задачи решает
- Ключевые точки тела на фото и видео
- Анализ движений в спорте и реабилитации
- Контроль рабочих поз и техники безопасности
- Подготовка скелета для анимации
Где применяется
Спорт и фитнесПроизводство и охрана трудаВидеопродакшн
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходитКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- ViTPose / ViTPose++ в Transformers
- ViTPose++
- ViTPose
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Компьютерное зрениеSapiensMeta · СШАКоммерция с условиями
Модели Meta для анализа человека на фото: ключевые точки позы, разметка частей тела, нормали и глубина. Sapiens2 обучены на высоком разрешении и добавили маттинг людей.
ПодробнееКомпьютерное зрениеYOLO (Ultralytics)Ultralytics · СШАКоммерция с условиямиСамый распространённый детектор объектов в реальном времени: находит и выделяет предметы на видео даже на слабом железе. YOLOv5 вышел ещё в 2020, в каталоге отсчёт от YOLOv8.
Подробнее

