Картинка + текст
InternVL
Большая линейка китайских моделей зрения с размерами от 1B до 241B. InternVL-U (4B) объединяет понимание картинок, их генерацию и редактирование.
- Разработчик
- Shanghai AI Laboratory (OpenGVLab), Китай
- Первый выпуск
- дек 2023
- Последний выпуск
- мар 2026
- Размеры
- 1B – 241B-A28B
- Лицензия
- Можно в коммерциюInternVL3.5 — Apache 2.0; InternVL-U — MIT; отдельные крупные версии наследуют лицензию базовой модели (например, Qwen)
Какие задачи решает
- Понимание документов, схем и графиков
- Ответы на вопросы по фото
- Разбор видео
- Генерация и правка картинок (InternVL-U)
Где применяется
ДокументооборотПромышленность и контроль качестваЭлектронная коммерция
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходитКластерСервер с несколькими видеокартами — флагманские версии
подходитВерсии
- InternVL-U
- InternVL3.5
- InternVL3
- InternVL2.5
- InternVL2
- InternVL 1.5
- InternVL
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Картинка + текстQwen-VLAlibaba (команда Qwen) · КитайМожно в коммерцию
Одна из сильнейших открытых моделей зрения: читает документы, таблицы, графики, видео, работает с интерфейсами. С Qwen3.5 зрение встроено прямо в основную модель Qwen.
ПодробнееТекстInternLM / Intern-SShanghai AI Laboratory · КитайМожно в коммерциюМодели Шанхайской лаборатории ИИ. Ранняя линия InternLM — универсальная, новая Intern-S1/S2 — научная: понимает формулы, молекулы, графики и картинки.
ПодробнееКартинка + текстMiniCPM-VOpenBMB (ModelBest и Университет Цинхуа) · КитайМожно в коммерциюКомпактные модели зрения, которые работают даже на телефоне и ноутбуке. Хорошо читают текст на фото, понимают видео; версия 4.6 весит всего 1.3B.
Подробнее

