Голос: спикеры и звук

Эмоции в русской речи (модели на датасете Dusha)

Модели, определяющие эмоцию по голосу в русской речи: нейтрально, злость, позитив, грусть. Обучены на открытом датасете Dusha от SberDevices.

Разработчик
Сообщество (xbgoose и др.), датасет Dusha от SberDevices, Россия
Первый выпуск
май 2023
Последний выпуск
июл 2025
Размеры
21M – 316M
Лицензия
Коммерция с условиямиApache 2.0 у HuBERT-large; у остальных версий лицензия на карточке не указана
Русский язык
Есть
Запуск
Через свой серверРаботает и без видеокарты
Сферы
Поддержка клиентов, Маркетинг и контент

Какие задачи решает

  • Поиск звонков с раздражённым клиентом
  • Оценка тона разговоров операторов
  • Приоритизация жалоб в колл-центре

Где применяется

Колл-центрыКонтроль качества обслуживания

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версий
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. Whisper-base SER Dusha
  2. HuBERT-base и WavLM Dusha
  3. HuBERT-large Dusha

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели