Картинка + текстДокументы и OCR
Qwen-VL
Одна из сильнейших открытых моделей зрения: читает документы, таблицы, графики, видео, работает с интерфейсами. С Qwen3.5 зрение встроено прямо в основную модель Qwen.
- Разработчик
- Alibaba (команда Qwen), Китай
- Первый выпуск
- авг 2023
- Последний выпуск
- окт 2025
- Размеры
- 2B – 235B-A22B
- Лицензия
- Можно в коммерциюQwen3-VL — Apache 2.0; у старых Qwen-VL и части Qwen2/2.5-VL (3B, 72B) собственные лицензии Qwen
Какие задачи решает
- Извлечение данных из сканов счетов и накладных
- Разбор фотографий товаров и витрин
- Анализ видео и записей с камер
- Агент, работающий с интерфейсом по скриншотам
Где применяется
Бухгалтерия и документооборотРозница и складЭлектронная коммерцияСлужбы поддержки
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходитКластерСервер с несколькими видеокартами — флагманские версии
подходитВерсии
- Qwen3-VL 2B – 32B
- Qwen3-VL 235B-A22B и 30B-A3B
- Qwen2.5-VL-32B
- Qwen2.5-VL
- Qwen2-VL
- Qwen-VL
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
ТекстQwenAlibaba · КитайКоммерция с условиями
Семейство языковых моделей с сильным русским языком: от маленьких версий для ноутбука до флагмана уровня коммерческих API.
ПодробнееКартинка + текстInternVLShanghai AI Laboratory (OpenGVLab) · КитайМожно в коммерциюБольшая линейка китайских моделей зрения с размерами от 1B до 241B. InternVL-U (4B) объединяет понимание картинок, их генерацию и редактирование.
ПодробнееКартинка + текстMiniCPM-VOpenBMB (ModelBest и Университет Цинхуа) · КитайМожно в коммерциюКомпактные модели зрения, которые работают даже на телефоне и ноутбуке. Хорошо читают текст на фото, понимают видео; версия 4.6 весит всего 1.3B.
Подробнее

