Эти модели определяют, кто и когда говорил на записи, очищают звук от шума, отделяют голос от музыки и распознают говорящего. Это важная часть аналитики звонков и расшифровки встреч. Проверьте качество на ваших записях, скорость обработки и лицензию.
Большая открытая коллекция моделей для отделения голоса от музыки и шумов: MDX-Net, BS-RoFormer, Mel-RoFormer, SCNet. Лидеры по качеству вокала среди открытых решений.
Набор готовых моделей «голосового отпечатка»: сравнивает, один ли человек говорит в двух записях, и помогает делить запись по спикерам. Одна из моделей встроена в pyannote 3.x.
Классическая модель, которая разделяет трек на голос, барабаны, бас и остальное. Версия v4 с гибридным трансформером остаётся эталоном; сейчас проект поддерживает автор в своём репозитории.
Самый массовый открытый инструмент конверсии голоса: модель под конкретный голос учится за 10–30 минут записи, работает в реальном времени. Использовать только с согласия владельца голоса.
Детектор речи и звуковых событий: отличает речь, пение и музыку. В тесте на 102 языках (набор FLEURS, русский входит) обошёл Silero VAD и TEN VAD. Есть потоковый режим.
Нарезка записей перед распознаванием речи
Отделение речи от музыки и пения в эфирах и роликах
Определяет по интонации, закончил ли человек мысль или просто сделал паузу, чтобы голосовой бот не перебивал. Версия 3 весит 8 МБ, работает на процессоре и понимает 23 языка, включая русский.
Голосовой бот не перебивает клиента на паузах
Быстрый ответ, когда клиент действительно договорил
Дополнение к обычному детектору речи в голосовых ассистентах
Модель вырезает из записи нужный звук по текстовому описанию, по отметке на видео или по отрезку: голос, инструмент, шум. Доступ к весам выдают по заявке.
Самый популярный открытый детектор речи: отличает голос от тишины и шума. Обрабатывает фрагмент звука меньше чем за миллисекунду на одном ядре процессора, обучен на записях более чем 6000 языков.
Нарезка звонков и записей перед распознаванием речи
Определение, когда клиент говорит, в голосовом боте
Модели NVIDIA для задачи «кто говорит»: TitaNet узнаёт голос конкретного человека, Sortformer размечает запись до 4 спикеров, в том числе потоково во время звонка.
Разметка разговоров по спикерам в реальном времени
Проверка, что звонит тот же человек (голосовой отпечаток)
National Institute of Informatics, Yamagishi Lab · Япония
Семь речевых энкодеров (wav2vec 2.0, XLS-R, MMS, HuBERT), дообученных различать живую и синтезированную речь. Разработчики сами отмечают: качество сильно зависит от набора данных, вывод проверяет человек.
Самый распространённый открытый инструмент, который размечает запись по спикерам: кто и когда говорил. Обычно ставится в связку с распознаванием речи. Веса выдаются после короткой анкеты на HF.
Набор моделей Alibaba для чистки речи: шумоподавление, разделение наложенных голосов, повышение качества звука до 48 кГц и выделение голоса по видео с лицом говорящего.
Лёгкий детектор речи для голосовых ассистентов в реальном времени: быстрее замечает начало и конец фразы, чем Silero VAD. Работает на сервере, телефоне и в браузере.
Синтез речи с клонированием голоса: хватает 5 секунд образца, а после дообучения на минуте записи голос звучит заметно точнее. Использовать только с согласия владельца голоса.
Конверсия голоса без обучения: переносит тембр по образцу в 1–30 секунд, умеет петь и работать в реальном времени, V2 меняет и акцент. Использовать только с согласия владельца голоса.
Незаметная метка в синтезированной речи и быстрый детектор, который находит её даже в куске длинной записи. Детектор ошибается в обе стороны: срабатывание — повод для проверки человеком, а не доказательство.
Пометка речи, синтезированной вашим сервисом
Поиск своей метки в чужих публикациях
Проверка, не подмешан ли синтез в запись разговора
Размеры
генератор и детектор водяного знака, 16 бит сообщения
Мгновенное клонирование голоса по короткому образцу с управлением эмоцией и акцентом, V2 говорит на нескольких языках. Использовать только с согласия владельца голоса.
Модель улучшения речи: убирает шум и дорисовывает потерянные частоты, так что глухая запись звучит как студийная. Хороша для подготовки голоса к озвучке.
Развитие AASIST: вместо сырого звука берётся речевой энкодер wav2vec 2.0, из-за чего модель лучше держится на незнакомых способах синтеза. Ошибается в обе стороны — итог проверяет человек.
Лёгкое шумоподавление речи в реальном времени: работает даже на обычном процессоре и на слабых устройствах. Убирает гул, улицу, шум офиса, оставляя голос.
Базовая открытая модель против подмены голоса: слушает сырую запись и отличает живого человека от синтеза и записи. Ошибается в обе стороны — её вывод повод для проверки человеком, а не доказательство.
Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.
ПодберуМодель и размер под задачу и бюджет на железо
ПоставлюНа ваш сервер или в закрытый контур, с API