Картинка + текст
LLaVA
Открытый проект, с которого пошла мода на модели «картинка + текст». Линейка OneVision понимает фото, документы и видео; открыты данные и рецепты обучения.
- Разработчик
- LLaVA / LMMs-Lab (исследователи из США и Китая), США / Китай
- Первый выпуск
- апр 2023
- Последний выпуск
- май 2026
- Размеры
- 0.5B – 72B
- Лицензия
- Можно в коммерциюНовые версии OneVision — Apache 2.0; первые LLaVA на Llama и Vicuna наследуют их лицензии
Какие задачи решает
- Ответы на вопросы по фото и скриншотам
- Описание товаров по фотографии
- Разбор видео по кадрам
- Основа для дообучения своей визуальной модели
Где применяется
Электронная коммерцияИсследовательские командыКонтроль контента
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходитКластерСервер с несколькими видеокартами — флагманские версии
подходитВерсии
- LLaVA-OneVision-2-8B
- LLaVA-OneVision-1.5
- LLaVA-OneVision
- LLaVA-NeXT (1.6)
- LLaVA-1.5
- LLaVA
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Картинка + текстQwen-VLAlibaba (команда Qwen) · КитайМожно в коммерцию
Одна из сильнейших открытых моделей зрения: читает документы, таблицы, графики, видео, работает с интерфейсами. С Qwen3.5 зрение встроено прямо в основную модель Qwen.
ПодробнееКартинка + текстInternVLShanghai AI Laboratory (OpenGVLab) · КитайМожно в коммерциюБольшая линейка китайских моделей зрения с размерами от 1B до 241B. InternVL-U (4B) объединяет понимание картинок, их генерацию и редактирование.
ПодробнееКартинка + текстMolmoAi2 (Allen Institute for AI) · СШАМожно в коммерциюПолностью открытые модели зрения Ai2 (веса и данные). Умеют указывать точку на картинке и считать предметы; Molmo2 понимает видео, MolmoWeb управляет браузером.
Подробнее

