Картинка + текст

MOSS-VL

Модель «картинка + видео + текст» с упором на длинные видео и точную привязку событий к секундам. Есть версия Realtime для потокового видео в реальном времени.

Разработчик
OpenMOSS (Фуданьский университет), Китай
Первый выпуск
апр 2026
Последний выпуск
июл 2026
Размеры
около 11B
Лицензия
Можно в коммерциюApache 2.0
Русский язык
Нет
Запуск
Через свой серверНужна видеокарта
Сферы
Медиа и продакшн, Безопасность, Документы и бухгалтерия

Какие задачи решает

  • Разбор длинных видео и поиск событий по времени
  • Потоковый анализ видео в реальном времени
  • Понимание фото и документов

Где применяется

Медиа и видеоархивыВидеонаблюдениеДокументооборот

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
нет версий
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходит
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. MOSS-VL-Realtime
  2. MOSS-VL 0708 (Base, Instruct)
  3. MOSS-VL 0408 (Base, Instruct)

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели