Компьютерное зрение
Sapiens
Модели Meta для анализа человека на фото: ключевые точки позы, разметка частей тела, нормали и глубина. Sapiens2 обучены на высоком разрешении и добавили маттинг людей.
- Разработчик
- Meta, США
- Первый выпуск
- авг 2024
- Последний выпуск
- май 2026
- Размеры
- 0.1B – 5B
- Лицензия
- Коммерция с условиямиSapiens — CC-BY-NC 4.0; Sapiens2 — собственная лицензия Meta, коммерция разрешена с условиями
- Запуск
- Через свой серверНужна видеокарта
- Сферы
- Медиа и продакшн, Торговля и маркетплейсы, Медицина
Какие задачи решает
- Определение позы и ключевых точек тела
- Разметка частей тела и одежды
- Отделение человека от фона
- Подготовка данных для примерки и аватаров
Где применяется
Фото- и видеопродакшнФэшн и онлайн-примеркаСпорт и фитнес-приложения
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходитКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- Sapiens2 Matting 1B
- Sapiens2 (0.1B – 5B)
- Sapiens (0.3B – 2B)
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Компьютерное зрениеViTPoseСиднейский университет и JD Explore Academy · Австралия / КитайМожно в коммерцию
Простая и точная модель определения позы человека по ключевым точкам. Версия ViTPose++ умеет позы людей, животных и всего тела; встроена в библиотеку Transformers.
ПодробнееКомпьютерное зрениеSegment Anything (SAM)Meta · СШАКоммерция с условиямиВыделяет любой объект на фото и видео по клику или рамке. Основа для удаления фона и подсчёта объектов.
ПодробнееКомпьютерное зрениеDepth AnythingByteDance и Гонконгский университет · КитайКоммерция с условиямиОпределяет глубину — расстояние до каждой точки — по одной обычной фотографии или видео. DA3 восстанавливает геометрию сцены с нескольких кадров.
Подробнее

