Речь в текст
Qwen3-ASR
Модели распознавания речи от команды Qwen на 50+ языков, включая русский. Хорошо справляются с шумом, пением и акцентами.
- Разработчик
- Alibaba (Qwen), Китай
- Первый выпуск
- янв 2026
- Последний выпуск
- июн 2026
- Размеры
- 0.6B – 1.7B
- Лицензия
- Можно в коммерциюApache 2.0
Какие задачи решает
- Расшифровка звонков и встреч
- Субтитры к видео
- Распознавание на нескольких языках
- Голосовой ввод в приложениях
Где применяется
Колл-центрыМедиа и онлайн-обучениеМеждународные компанииГолосовые боты
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версийКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- Версии для Transformers (-hf)
- Qwen3-ASR 0.6B и 1.7B
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Речь в текстWhisperOpenAI · СШАМожно в коммерцию
Распознавание речи на 99 языках, включая русский. Стандарт де-факто для расшифровки звонков и встреч.
ПодробнееРечь в текстNVIDIA Parakeet / Canary / Nemotron SpeechNVIDIA · СШАКоммерция с условиямиБыстрые модели распознавания речи от NVIDIA, в том числе потоковые для работы в реальном времени. Parakeet TDT v3 и Nemotron 3.5 ASR понимают русский.
ПодробнееРечь в текстSenseVoice / Paraformer / Fun-ASRAlibaba (Tongyi, FunAudioLLM) · КитайКоммерция с условиямиНабор моделей Alibaba для быстрого распознавания речи, в первую очередь китайской и азиатских языков. SenseVoice дополнительно определяет эмоции и звуковые события.
Подробнее

