Речь в текст

Qwen3-ASR

Модели распознавания речи от команды Qwen на 50+ языков, включая русский. Хорошо справляются с шумом, пением и акцентами.

Разработчик
Alibaba (Qwen), Китай
Первый выпуск
янв 2026
Последний выпуск
июн 2026
Размеры
0.6B – 1.7B
Лицензия
Можно в коммерциюApache 2.0

Какие задачи решает

  • Расшифровка звонков и встреч
  • Субтитры к видео
  • Распознавание на нескольких языках
  • Голосовой ввод в приложениях

Где применяется

Колл-центрыМедиа и онлайн-обучениеМеждународные компанииГолосовые боты

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версий
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. Версии для Transformers (-hf)
  2. Qwen3-ASR 0.6B и 1.7B

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели