Речь в текст
SenseVoice / Paraformer / Fun-ASR
Набор моделей Alibaba для быстрого распознавания речи, в первую очередь китайской и азиатских языков. SenseVoice дополнительно определяет эмоции и звуковые события.
- Разработчик
- Alibaba (Tongyi, FunAudioLLM), Китай
- Первый выпуск
- июл 2024
- Последний выпуск
- дек 2025
- Размеры
- около 230M – 800M
- Лицензия
- Коммерция с условиямиSenseVoice Small — собственная лицензия FunASR; Fun-ASR-Nano — Apache 2.0
Какие задачи решает
- Расшифровка звонков
- Определение эмоций в голосе
- Распознавание смеха, музыки и других звуков
- Голосовые боты
Где применяется
Колл-центрыРабота с азиатскими рынкамиМедиаГолосовые интерфейсы
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версийКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- Fun-ASR-Nano и Fun-ASR-MLT-Nano
- SenseVoice Small
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Речь в текстWhisperOpenAI · СШАМожно в коммерцию
Распознавание речи на 99 языках, включая русский. Стандарт де-факто для расшифровки звонков и встреч.
ПодробнееРечь в текстQwen3-ASRAlibaba (Qwen) · КитайМожно в коммерциюМодели распознавания речи от команды Qwen на 50+ языков, включая русский. Хорошо справляются с шумом, пением и акцентами.
ПодробнееРечь в текстNVIDIA Parakeet / Canary / Nemotron SpeechNVIDIA · СШАКоммерция с условиямиБыстрые модели распознавания речи от NVIDIA, в том числе потоковые для работы в реальном времени. Parakeet TDT v3 и Nemotron 3.5 ASR понимают русский.
Подробнее

