Голос: спикеры и звук
WeSpeaker
Набор готовых моделей «голосового отпечатка»: сравнивает, один ли человек говорит в двух записях, и помогает делить запись по спикерам. Одна из моделей встроена в pyannote 3.x.
- Разработчик
- Сообщество WeNet, Китай
- Первый выпуск
- ноя 2022
- Последний выпуск
- июл 2026
- Размеры
- от единиц до десятков миллионов параметров
- Лицензия
- Можно в коммерциюКод Apache 2.0; веса CC-BY 4.0 (VoxCeleb) и Apache 2.0 (CN-Celeb)
Какие задачи решает
- Голосовая проверка клиента при звонке
- Поиск повторных звонков одного человека
- Разметка записи по спикерам
Где применяется
Банки и страхованиеКолл-центрыСлужбы безопасности
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версийКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- ReDimNet2
- Модели на HF (ResNet, ECAPA, CAM++)
- WeSpeaker 1.2
- WeSpeaker 1.0
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Голос: спикеры и звукpyannote (диаризация)pyannoteAI (Эрве Бредин) · ФранцияМожно в коммерцию
Самый распространённый открытый инструмент, который размечает запись по спикерам: кто и когда говорил. Обычно ставится в связку с распознаванием речи. Веса выдаются после короткой анкеты на HF.
ПодробнееГолос: спикеры и звукNVIDIA Sortformer / TitaNetNVIDIA · СШАКоммерция с условиямиМодели NVIDIA для задачи «кто говорит»: TitaNet узнаёт голос конкретного человека, Sortformer размечает запись до 4 спикеров, в том числе потоково во время звонка.
Подробнее

