Картинка + текст
Kimi-VL
Экономичная MoE-модель зрения (16B, активны 3B) с длинным контекстом и рассуждающей версией. Хорошо разбирает длинные документы и видео.
- Разработчик
- Moonshot AI, Китай
- Первый выпуск
- апр 2025
- Последний выпуск
- июн 2025
- Размеры
- 16B-A3B
- Лицензия
- Можно в коммерциюMIT
Какие задачи решает
- Разбор длинных PDF и презентаций
- Ответы на вопросы по видео
- Работа с интерфейсами по скриншотам
Где применяется
ДокументооборотАналитикаСлужбы поддержки
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
нет версий1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходитКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- Kimi-VL-A3B-Thinking-2506
- Kimi-VL-A3B Instruct и Thinking
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
ТекстKimiMoonshot AI · КитайКоммерция с условиями
Сверхкрупные MoE-модели Moonshot для агентной работы. K3 на 2,8 трлн параметров — самая большая открытая модель на момент выхода, с контекстом до 1 млн токенов и пониманием картинок.
ПодробнееКартинка + текстQwen-VLAlibaba (команда Qwen) · КитайМожно в коммерциюОдна из сильнейших открытых моделей зрения: читает документы, таблицы, графики, видео, работает с интерфейсами. С Qwen3.5 зрение встроено прямо в основную модель Qwen.
ПодробнееКартинка + текстKeye-VLKuaishou · КитайМожно в коммерциюМодели зрения от Kuaishou с упором на короткие видео. Keye-VL-2.0 (30B, активны 3B) хорошо понимает, что и когда происходит в ролике.
Подробнее

