Голос: спикеры и звукМузыка и звук

Demucs

Классическая модель, которая разделяет трек на голос, барабаны, бас и остальное. Версия v4 с гибридным трансформером остаётся эталоном; сейчас проект поддерживает автор в своём репозитории.

Разработчик
Meta AI, затем Александр Дефоссе, Франция
Первый выпуск
дек 2022
Последний выпуск
июл 2026
Размеры
десятки миллионов параметров
Лицензия
Можно в коммерциюMIT

Какие задачи решает

  • Отделить голос от музыки в записи
  • Минусовки и дорожки для караоке
  • Очистка речи в видео с фоновой музыкой

Где применяется

Медиа и продакшнМузыкальные сервисыКараоке и развлечения

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходит
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. Demucs 4.1.0
  2. Demucs 4.0.1
  3. Demucs v4 (Hybrid Transformer)

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели