АватарыВидео
Wav2Lip
Классическая модель синхронизации губ с аудио, до сих пор популярна в любительских сборках. Губы точные, но картинка лица размытая, лицензия некоммерческая.
- Разработчик
- IIIT Hyderabad, Индия
- Первый выпуск
- авг 2020
- Последний выпуск
- авг 2020
- Размеры
- малая модель, лицо 96 пикселей
- Лицензия
- Только некоммерческоеТолько личное, исследовательское и некоммерческое использование (обучена на датасете LRS2); коммерция — через авторов
- Запуск
- Через свой серверНужна видеокарта
- Сферы
- Медиа и продакшн, Образование
Какие задачи решает
- Быстрые пробы переозвучки
- Сравнение с новыми lip-sync моделями
- Учебные и исследовательские проекты
Где применяется
Исследования и вузыПрототипы видеосервисов
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версийКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- Wav2Lip и Wav2Lip + GAN
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
АватарыLatentSyncByteDance · КитайКоммерция с условиями
Подгоняет движения губ на готовом видео под новую озвучку. Версия 1.6 работает в 512 пикселей и даёт более чёткое лицо.
ПодробнееАватарыMuseTalkTencent Music (Lyra Lab) · КитайМожно в коммерциюСинхронизация губ в реальном времени: подгоняет рот на видео под новое аудио. Подходит для перевода видео и живых аватаров.
ПодробнееАватарыSadTalkerСианьский университет Цзяотун и Tencent AI Lab · КитайМожно в коммерциюСтарая лёгкая модель говорящей головы: одно фото и аудио превращаются в видео. Работает на слабом железе, но качество заметно ниже новых.
Подробнее

