Речь в текст

SenseVoice / Paraformer / Fun-ASR

Набор моделей Alibaba для быстрого распознавания речи, в первую очередь китайской и азиатских языков. SenseVoice дополнительно определяет эмоции и звуковые события.

Разработчик
Alibaba (Tongyi, FunAudioLLM), Китай
Первый выпуск
июл 2024
Последний выпуск
дек 2025
Размеры
около 230M – 800M
Лицензия
Коммерция с условиямиSenseVoice Small — собственная лицензия FunASR; Fun-ASR-Nano — Apache 2.0

Какие задачи решает

  • Расшифровка звонков
  • Определение эмоций в голосе
  • Распознавание смеха, музыки и других звуков
  • Голосовые боты

Где применяется

Колл-центрыРабота с азиатскими рынкамиМедиаГолосовые интерфейсы

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версий
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. Fun-ASR-Nano и Fun-ASR-MLT-Nano
  2. SenseVoice Small

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели