Голосовые ассистентыКартинка + текст

Qwen Omni

Модели, которые понимают текст, картинки, аудио и видео и отвечают голосом в реальном времени. Qwen3-Omni говорит на 10 языках, включая русский.

Разработчик
Alibaba (Qwen), Китай
Первый выпуск
мар 2025
Последний выпуск
сен 2025
Размеры
3B – 30B-A3B
Лицензия
Можно в коммерциюApache 2.0

Какие задачи решает

  • Голосовой ассистент для клиентов
  • Разбор звонков и видео
  • Ответы голосом по документам и картинкам
  • Описание аудиозаписей

Где применяется

Колл-центрыРитейл и сервисМедиаВнутренние помощники

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходит
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. Qwen3-Omni 30B-A3B (Instruct, Thinking, Captioner)
  2. Qwen2.5-Omni 3B
  3. Qwen2.5-Omni 7B

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели