Голос: спикеры и звукМузыка и звук
Demucs
Классическая модель, которая разделяет трек на голос, барабаны, бас и остальное. Версия v4 с гибридным трансформером остаётся эталоном; сейчас проект поддерживает автор в своём репозитории.
- Разработчик
- Meta AI, затем Александр Дефоссе, Франция
- Первый выпуск
- дек 2022
- Последний выпуск
- июл 2026
- Размеры
- десятки миллионов параметров
- Лицензия
- Можно в коммерциюMIT
Какие задачи решает
- Отделить голос от музыки в записи
- Минусовки и дорожки для караоке
- Очистка речи в видео с фоновой музыкой
Где применяется
Медиа и продакшнМузыкальные сервисыКараоке и развлечения
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходитКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- Demucs 4.1.0
- Demucs 4.0.1
- Demucs v4 (Hybrid Transformer)
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Голос: спикеры и звукUVR / MDX-Net / RoFormer (разделение звука)Сообщество: Ultimate Vocal Remover (Anjok07), ZFTurbo, MVSep · Международное сообществоКоммерция с условиями
Большая открытая коллекция моделей для отделения голоса от музыки и шумов: MDX-Net, BS-RoFormer, Mel-RoFormer, SCNet. Лидеры по качеству вокала среди открытых решений.
ПодробнееГолос: спикеры и звукSAM AudioMeta · СШАКоммерция с условиямиМодель вырезает из записи нужный звук по текстовому описанию, по отметке на видео или по отрезку: голос, инструмент, шум. Доступ к весам выдают по заявке.
ПодробнееГолос: спикеры и звукClearerVoice (MossFormer)Alibaba (Tongyi Lab) · КитайМожно в коммерциюНабор моделей Alibaba для чистки речи: шумоподавление, разделение наложенных голосов, повышение качества звука до 48 кГц и выделение голоса по видео с лицом говорящего.
Подробнее

