Голос: спикеры и звукМузыка и звук
UVR / MDX-Net / RoFormer (разделение звука)
Большая открытая коллекция моделей для отделения голоса от музыки и шумов: MDX-Net, BS-RoFormer, Mel-RoFormer, SCNet. Лидеры по качеству вокала среди открытых решений.
- Разработчик
- Сообщество: Ultimate Vocal Remover (Anjok07), ZFTurbo, MVSep, Международное сообщество
- Первый выпуск
- дек 2022
- Последний выпуск
- авг 2026
- Размеры
- от десятков до сотен миллионов параметров
- Лицензия
- Коммерция с условиямиКод MIT; у отдельных весов разные условия, проверять по каждой модели
Какие задачи решает
- Чистый голос из записи с музыкой
- Минусовки и стемы для караоке
- Удаление фоновой музыки и шума из роликов
Где применяется
Медиа и продакшнМузыкальные студииКараоке
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходитКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- DTTNet
- BS PolarFormer, MVSep Mega
- SCNet XL
- Mel-/BS-RoFormer
- MSST: MDX23C и первые веса
- UVR 5.6
- UVR 5.5
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Голос: спикеры и звукDemucsMeta AI, затем Александр Дефоссе · ФранцияМожно в коммерцию
Классическая модель, которая разделяет трек на голос, барабаны, бас и остальное. Версия v4 с гибридным трансформером остаётся эталоном; сейчас проект поддерживает автор в своём репозитории.
ПодробнееГолос: спикеры и звукSAM AudioMeta · СШАКоммерция с условиямиМодель вырезает из записи нужный звук по текстовому описанию, по отметке на видео или по отрезку: голос, инструмент, шум. Доступ к весам выдают по заявке.
Подробнее

