Голос: спикеры и звук
Эмоции в русской речи (модели на датасете Dusha)
Модели, определяющие эмоцию по голосу в русской речи: нейтрально, злость, позитив, грусть. Обучены на открытом датасете Dusha от SberDevices.
- Разработчик
- Сообщество (xbgoose и др.), датасет Dusha от SberDevices, Россия
- Первый выпуск
- май 2023
- Последний выпуск
- июл 2025
- Размеры
- 21M – 316M
- Лицензия
- Коммерция с условиямиApache 2.0 у HuBERT-large; у остальных версий лицензия на карточке не указана
- Русский язык
- Есть
- Запуск
- Через свой серверРаботает и без видеокарты
- Сферы
- Поддержка клиентов, Маркетинг и контент
Какие задачи решает
- Поиск звонков с раздражённым клиентом
- Оценка тона разговоров операторов
- Приоритизация жалоб в колл-центре
Где применяется
Колл-центрыКонтроль качества обслуживания
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версийКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- Whisper-base SER Dusha
- HuBERT-base и WavLM Dusha
- HuBERT-large Dusha
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Речь в текстGigaAMСбер · РоссияМожно в коммерцию
Модели Сбера для распознавания русской речи, одни из самых точных для русского языка. Есть распознавание эмоций, версия v3 с пунктуацией и многоязычная версия (русский, казахский, киргизский, узбекский).
ПодробнееРечь в текстSenseVoice / Paraformer / Fun-ASRAlibaba (Tongyi, FunAudioLLM) · КитайКоммерция с условиямиНабор моделей Alibaba для быстрого распознавания речи, в первую очередь китайской и азиатских языков. SenseVoice дополнительно определяет эмоции и звуковые события.
Подробнее

