Голос: спикеры и звук2022–2026
Сообщество: Ultimate Vocal Remover (Anjok07), ZFTurbo, MVSep · Международное сообщество
Большая открытая коллекция моделей для отделения голоса от музыки и шумов: MDX-Net, BS-RoFormer, Mel-RoFormer, SCNet. Лидеры по качеству вокала среди открытых решений.
- Чистый голос из записи с музыкой
- Минусовки и стемы для караоке
- Удаление фоновой музыки и шума из роликов
- Размеры
- от десятков до сотен миллионов параметров
- Железо
- от: Ноутбук
Голос: спикеры и звукGGUF2022–2026
Сообщество WeNet · Китай
Набор готовых моделей «голосового отпечатка»: сравнивает, один ли человек говорит в двух записях, и помогает делить запись по спикерам. Одна из моделей встроена в pyannote 3.x.
- Голосовая проверка клиента при звонке
- Поиск повторных звонков одного человека
- Разметка записи по спикерам
- Размеры
- от единиц до десятков миллионов параметров
- Железо
- от: Ноутбук
Голос: спикеры и звук2022–2026
Meta AI, затем Александр Дефоссе · Франция
Классическая модель, которая разделяет трек на голос, барабаны, бас и остальное. Версия v4 с гибридным трансформером остаётся эталоном; сейчас проект поддерживает автор в своём репозитории.
- Отделить голос от музыки в записи
- Минусовки и дорожки для караоке
- Очистка речи в видео с фоновой музыкой
- Размеры
- десятки миллионов параметров
- Железо
- от: Ноутбук
Голос: спикеры и звук2023–2026
Сообщество RVC-Project · Китай
Самый массовый открытый инструмент конверсии голоса: модель под конкретный голос учится за 10–30 минут записи, работает в реальном времени. Использовать только с согласия владельца голоса.
- Озвучка контента одним фирменным голосом
- Перепевка и работа с вокалом
- Смена голоса в реальном времени
- Размеры
- десятки миллионов параметров
- Железо
- от: Ноутбук
Голос: спикеры и звукRU2026
FireRedTeam (Xiaohongshu) · Китай
Детектор речи и звуковых событий: отличает речь, пение и музыку. В тесте на 102 языках (набор FLEURS, русский входит) обошёл Silero VAD и TEN VAD. Есть потоковый режим.
- Нарезка записей перед распознаванием речи
- Отделение речи от музыки и пения в эфирах и роликах
- Определение речи в голосовых ботах
- Размеры
- компактная, точный размер не указан
- Железо
- от: Ноутбук
Голос: спикеры и звукRU2025–2026
Daily (Pipecat) · США
Определяет по интонации, закончил ли человек мысль или просто сделал паузу, чтобы голосовой бот не перебивал. Версия 3 весит 8 МБ, работает на процессоре и понимает 23 языка, включая русский.
- Голосовой бот не перебивает клиента на паузах
- Быстрый ответ, когда клиент действительно договорил
- Дополнение к обычному детектору речи в голосовых ассистентах
- Размеры
- 8M (v3) – 580M (v1)
- Железо
- от: Ноутбук
Голос: спикеры и звукRU2020–2025
Silero · Россия
Самый популярный открытый детектор речи: отличает голос от тишины и шума. Обрабатывает фрагмент звука меньше чем за миллисекунду на одном ядре процессора, обучен на записях более чем 6000 языков.
- Нарезка звонков и записей перед распознаванием речи
- Определение, когда клиент говорит, в голосовом боте
- Отсев тишины и шума, экономия на расшифровке
- Размеры
- около 2 МБ
- Железо
- от: Ноутбук
Голос: спикеры и звук2022–2025
NVIDIA · США
Модели NVIDIA для задачи «кто говорит»: TitaNet узнаёт голос конкретного человека, Sortformer размечает запись до 4 спикеров, в том числе потоково во время звонка.
- Разметка разговоров по спикерам в реальном времени
- Проверка, что звонит тот же человек (голосовой отпечаток)
- Подготовка расшифровок совещаний
- Размеры
- 23M (TitaNet) – 117M (Sortformer)
- Железо
- от: Ноутбук
Голос: спикеры и звук2022–2025
pyannoteAI (Эрве Бредин) · Франция
Самый распространённый открытый инструмент, который размечает запись по спикерам: кто и когда говорил. Обычно ставится в связку с распознаванием речи. Веса выдаются после короткой анкеты на HF.
- Разметка звонков: где оператор, где клиент
- Протоколы совещаний с подписью спикеров
- Подготовка записей к расшифровке и анализу
- Размеры
- несколько миллионов параметров
- Железо
- от: Ноутбук
Голос: спикеры и звук2024–2025
Alibaba (Tongyi Lab) · Китай
Набор моделей Alibaba для чистки речи: шумоподавление, разделение наложенных голосов, повышение качества звука до 48 кГц и выделение голоса по видео с лицом говорящего.
- Шумоподавление записей разговоров
- Разделение двух голосов, говорящих одновременно
- Улучшение старых и телефонных записей
- Размеры
- менее 1B
- Железо
- от: Ноутбук
Голос: спикеры и звук2025
Agora (проект TEN) · США / Китай
Лёгкий детектор речи для голосовых ассистентов в реальном времени: быстрее замечает начало и конец фразы, чем Silero VAD. Работает на сервере, телефоне и в браузере.
- Определение речи в голосовом боте без задержек
- Быстрая реакция ассистента на конец фразы
- Работа в мобильных приложениях и браузере
- Размеры
- очень малая, библиотека меньше Silero VAD
- Железо
- от: Ноутбук
Голос: спикеры и звукRU2023–2025
Сообщество (xbgoose и др.), датасет Dusha от SberDevices · Россия
Модели, определяющие эмоцию по голосу в русской речи: нейтрально, злость, позитив, грусть. Обучены на открытом датасете Dusha от SberDevices.
- Поиск звонков с раздражённым клиентом
- Оценка тона разговоров операторов
- Приоритизация жалоб в колл-центре
- Размеры
- 21M – 316M
- Железо
- от: Ноутбук