Картинка + текст

LLaVA

Открытый проект, с которого пошла мода на модели «картинка + текст». Линейка OneVision понимает фото, документы и видео; открыты данные и рецепты обучения.

Разработчик
LLaVA / LMMs-Lab (исследователи из США и Китая), США / Китай
Первый выпуск
апр 2023
Последний выпуск
май 2026
Размеры
0.5B – 72B
Лицензия
Можно в коммерциюНовые версии OneVision — Apache 2.0; первые LLaVA на Llama и Vicuna наследуют их лицензии

Какие задачи решает

  • Ответы на вопросы по фото и скриншотам
  • Описание товаров по фотографии
  • Разбор видео по кадрам
  • Основа для дообучения своей визуальной модели

Где применяется

Электронная коммерцияИсследовательские командыКонтроль контента

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходит
КластерСервер с несколькими видеокартами — флагманские версии
подходит

Версии

  1. LLaVA-OneVision-2-8B
  2. LLaVA-OneVision-1.5
  3. LLaVA-OneVision
  4. LLaVA-NeXT (1.6)
  5. LLaVA-1.5
  6. LLaVA

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели