Открытые модели для работы с голосом и звуком

Эти модели определяют, кто и когда говорил на записи, очищают звук от шума, отделяют голос от музыки и распознают говорящего. Это важная часть аналитики звонков и расшифровки встреч. Проверьте качество на ваших записях, скорость обработки и лицензию.

В подборке 22 семейства открытых моделей.Обновлено 22.09.2026Открыть весь каталог с фильтрами
Голос: спикеры и звук2022–2026

UVR / MDX-Net / RoFormer (разделение звука)

Сообщество: Ultimate Vocal Remover (Anjok07), ZFTurbo, MVSep · Международное сообщество

Большая открытая коллекция моделей для отделения голоса от музыки и шумов: MDX-Net, BS-RoFormer, Mel-RoFormer, SCNet. Лидеры по качеству вокала среди открытых решений.

  • Чистый голос из записи с музыкой
  • Минусовки и стемы для караоке
  • Удаление фоновой музыки и шума из роликов
Размеры
от десятков до сотен миллионов параметров
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Голос: спикеры и звукGGUF2022–2026

WeSpeaker

Сообщество WeNet · Китай

Набор готовых моделей «голосового отпечатка»: сравнивает, один ли человек говорит в двух записях, и помогает делить запись по спикерам. Одна из моделей встроена в pyannote 3.x.

  • Голосовая проверка клиента при звонке
  • Поиск повторных звонков одного человека
  • Разметка записи по спикерам
Размеры
от единиц до десятков миллионов параметров
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голос: спикеры и звук2022–2026

Demucs

Meta AI, затем Александр Дефоссе · Франция

Классическая модель, которая разделяет трек на голос, барабаны, бас и остальное. Версия v4 с гибридным трансформером остаётся эталоном; сейчас проект поддерживает автор в своём репозитории.

  • Отделить голос от музыки в записи
  • Минусовки и дорожки для караоке
  • Очистка речи в видео с фоновой музыкой
Размеры
десятки миллионов параметров
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голос: спикеры и звук2023–2026

RVC (Retrieval-based Voice Conversion)

Сообщество RVC-Project · Китай

Самый массовый открытый инструмент конверсии голоса: модель под конкретный голос учится за 10–30 минут записи, работает в реальном времени. Использовать только с согласия владельца голоса.

  • Озвучка контента одним фирменным голосом
  • Перепевка и работа с вокалом
  • Смена голоса в реальном времени
Размеры
десятки миллионов параметров
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голос: спикеры и звукRU2026

FireRedVAD

FireRedTeam (Xiaohongshu) · Китай

Детектор речи и звуковых событий: отличает речь, пение и музыку. В тесте на 102 языках (набор FLEURS, русский входит) обошёл Silero VAD и TEN VAD. Есть потоковый режим.

  • Нарезка записей перед распознаванием речи
  • Отделение речи от музыки и пения в эфирах и роликах
  • Определение речи в голосовых ботах
Размеры
компактная, точный размер не указан
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голос: спикеры и звукRU2025–2026

Smart Turn

Daily (Pipecat) · США

Определяет по интонации, закончил ли человек мысль или просто сделал паузу, чтобы голосовой бот не перебивал. Версия 3 весит 8 МБ, работает на процессоре и понимает 23 языка, включая русский.

  • Голосовой бот не перебивает клиента на паузах
  • Быстрый ответ, когда клиент действительно договорил
  • Дополнение к обычному детектору речи в голосовых ассистентах
Размеры
8M (v3) – 580M (v1)
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голос: спикеры и звук2025

SAM Audio

Meta · США

Модель вырезает из записи нужный звук по текстовому описанию, по отметке на видео или по отрезку: голос, инструмент, шум. Доступ к весам выдают по заявке.

  • Выделить голос одного человека из шумной записи
  • Убрать посторонний звук из видео
  • Разобрать запись на отдельные источники звука
Размеры
small, base, large (от 5 до 15 ГБ весов)
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Голос: спикеры и звукRU2020–2025

Silero VAD

Silero · Россия

Самый популярный открытый детектор речи: отличает голос от тишины и шума. Обрабатывает фрагмент звука меньше чем за миллисекунду на одном ядре процессора, обучен на записях более чем 6000 языков.

  • Нарезка звонков и записей перед распознаванием речи
  • Определение, когда клиент говорит, в голосовом боте
  • Отсев тишины и шума, экономия на расшифровке
Размеры
около 2 МБ
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голос: спикеры и звук2022–2025

NVIDIA Sortformer / TitaNet

NVIDIA · США

Модели NVIDIA для задачи «кто говорит»: TitaNet узнаёт голос конкретного человека, Sortformer размечает запись до 4 спикеров, в том числе потоково во время звонка.

  • Разметка разговоров по спикерам в реальном времени
  • Проверка, что звонит тот же человек (голосовой отпечаток)
  • Подготовка расшифровок совещаний
Размеры
23M (TitaNet) – 117M (Sortformer)
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Детекция подделок2025

AntiDeepfake (NII)

National Institute of Informatics, Yamagishi Lab · Япония

Семь речевых энкодеров (wav2vec 2.0, XLS-R, MMS, HuBERT), дообученных различать живую и синтезированную речь. Разработчики сами отмечают: качество сильно зависит от набора данных, вывод проверяет человек.

  • Проверка аудиозаписей на синтез
  • Дообучение под свой язык и канал записи
  • Сравнение нескольких энкодеров на своих данных
Размеры
0,3B – 2B
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Голос: спикеры и звук2022–2025

pyannote (диаризация)

pyannoteAI (Эрве Бредин) · Франция

Самый распространённый открытый инструмент, который размечает запись по спикерам: кто и когда говорил. Обычно ставится в связку с распознаванием речи. Веса выдаются после короткой анкеты на HF.

  • Разметка звонков: где оператор, где клиент
  • Протоколы совещаний с подписью спикеров
  • Подготовка записей к расшифровке и анализу
Размеры
несколько миллионов параметров
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голос: спикеры и звук2024–2025

ClearerVoice (MossFormer)

Alibaba (Tongyi Lab) · Китай

Набор моделей Alibaba для чистки речи: шумоподавление, разделение наложенных голосов, повышение качества звука до 48 кГц и выделение голоса по видео с лицом говорящего.

  • Шумоподавление записей разговоров
  • Разделение двух голосов, говорящих одновременно
  • Улучшение старых и телефонных записей
Размеры
менее 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голос: спикеры и звук2025

TEN VAD

Agora (проект TEN) · США / Китай

Лёгкий детектор речи для голосовых ассистентов в реальном времени: быстрее замечает начало и конец фразы, чем Silero VAD. Работает на сервере, телефоне и в браузере.

  • Определение речи в голосовом боте без задержек
  • Быстрая реакция ассистента на конец фразы
  • Работа в мобильных приложениях и браузере
Размеры
очень малая, библиотека меньше Silero VAD
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Голос: спикеры и звукRU2023–2025

Эмоции в русской речи (модели на датасете Dusha)

Сообщество (xbgoose и др.), датасет Dusha от SberDevices · Россия

Модели, определяющие эмоцию по голосу в русской речи: нейтрально, злость, позитив, грусть. Обучены на открытом датасете Dusha от SberDevices.

  • Поиск звонков с раздражённым клиентом
  • Оценка тона разговоров операторов
  • Приоритизация жалоб в колл-центре
Размеры
21M – 316M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Голос: спикеры и звук2024–2025

GPT-SoVITS

RVC-Boss и сообщество · Китай

Синтез речи с клонированием голоса: хватает 5 секунд образца, а после дообучения на минуте записи голос звучит заметно точнее. Использовать только с согласия владельца голоса.

  • Озвучка текстов голосом конкретного диктора
  • Голос для бота или ассистента
  • Дубляж обучающих роликов
Размеры
менее 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голос: спикеры и звук2024–2025

Seed-VC

Songting Liu (Plachtaa) · Китай

Конверсия голоса без обучения: переносит тембр по образцу в 1–30 секунд, умеет петь и работать в реальном времени, V2 меняет и акцент. Использовать только с согласия владельца голоса.

  • Переозвучка ролика другим голосом
  • Анонимизация голоса в записях
  • Голос в реальном времени для стримов
Размеры
около 70M – 200M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Детекция подделок2024

AudioSeal

Meta · США

Незаметная метка в синтезированной речи и быстрый детектор, который находит её даже в куске длинной записи. Детектор ошибается в обе стороны: срабатывание — повод для проверки человеком, а не доказательство.

  • Пометка речи, синтезированной вашим сервисом
  • Поиск своей метки в чужих публикациях
  • Проверка, не подмешан ли синтез в запись разговора
Размеры
генератор и детектор водяного знака, 16 бит сообщения
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голос: спикеры и звукНе развивается2024

OpenVoice

MyShell и MIT · США

Мгновенное клонирование голоса по короткому образцу с управлением эмоцией и акцентом, V2 говорит на нескольких языках. Использовать только с согласия владельца голоса.

  • Озвучка роликов голосом диктора компании
  • Голосовой бот с узнаваемым голосом бренда
  • Перенос тембра на готовый синтез речи
Размеры
менее 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голос: спикеры и звукНе развивается2023

Resemble Enhance

Resemble AI · США

Модель улучшения речи: убирает шум и дорисовывает потерянные частоты, так что глухая запись звучит как студийная. Хороша для подготовки голоса к озвучке.

  • Реставрация старых и телефонных записей
  • Очистка голоса перед озвучкой и клонированием
  • Улучшение звука в роликах и подкастах
Размеры
менее 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Детекция подделокНе развивается2022–2023

SSL Anti-spoofing (wav2vec 2.0 + AASIST)

EURECOM · Франция

Развитие AASIST: вместо сырого звука берётся речевой энкодер wav2vec 2.0, из-за чего модель лучше держится на незнакомых способах синтеза. Ошибается в обе стороны — итог проверяет человек.

  • Обнаружение синтезированной речи в звонках
  • Проверка голосовых сообщений и записей
  • Дообучение под свои данные и кодеки
Размеры
около 0,3B (энкодер wav2vec 2.0 XLS-R)
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голос: спикеры и звукНе развивается2022–2023

DeepFilterNet

Хендрик Шретер (Университет Эрлангена) · Германия

Лёгкое шумоподавление речи в реальном времени: работает даже на обычном процессоре и на слабых устройствах. Убирает гул, улицу, шум офиса, оставляя голос.

  • Очистка звонков и голосовых сообщений от шума
  • Подготовка записей перед распознаванием речи
  • Шумодав для видеосвязи
Размеры
около 2M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Детекция подделокНе развивается2021

AASIST

NAVER Clova AI Research и EURECOM · Южная Корея

Базовая открытая модель против подмены голоса: слушает сырую запись и отличает живого человека от синтеза и записи. Ошибается в обе стороны — её вывод повод для проверки человеком, а не доказательство.

  • Проверка голоса при телефонной аутентификации
  • Отсев записей и синтеза в голосовом меню
  • Базовая линия при сравнении детекторов голоса
Размеры
файлы весов 0,4 и 1,3 МБ
Железо
от: Ноутбук
Можно в коммерциюПодробнее

Подборки

Нужна модель под вашу задачу?

Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.

  1. ПодберуМодель и размер под задачу и бюджет на железо
  2. ПоставлюНа ваш сервер или в закрытый контур, с API
  3. ДообучуНа ваших данных или подключу базу знаний
  4. ВстроюВ CRM, 1С, бота, сайт или рабочий чат
Обсудить внедрение