Голос: спикеры и звук

WeSpeaker

Набор готовых моделей «голосового отпечатка»: сравнивает, один ли человек говорит в двух записях, и помогает делить запись по спикерам. Одна из моделей встроена в pyannote 3.x.

Разработчик
Сообщество WeNet, Китай
Первый выпуск
ноя 2022
Последний выпуск
июл 2026
Размеры
от единиц до десятков миллионов параметров
Лицензия
Можно в коммерциюКод Apache 2.0; веса CC-BY 4.0 (VoxCeleb) и Apache 2.0 (CN-Celeb)

Какие задачи решает

  • Голосовая проверка клиента при звонке
  • Поиск повторных звонков одного человека
  • Разметка записи по спикерам

Где применяется

Банки и страхованиеКолл-центрыСлужбы безопасности

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версий
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. ReDimNet2
  2. Модели на HF (ResNet, ECAPA, CAM++)
  3. WeSpeaker 1.2
  4. WeSpeaker 1.0

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели