Картинка + текст
MOSS-VL
Модель «картинка + видео + текст» с упором на длинные видео и точную привязку событий к секундам. Есть версия Realtime для потокового видео в реальном времени.
- Разработчик
- OpenMOSS (Фуданьский университет), Китай
- Первый выпуск
- апр 2026
- Последний выпуск
- июл 2026
- Размеры
- около 11B
- Лицензия
- Можно в коммерциюApache 2.0
- Русский язык
- Нет
- Запуск
- Через свой серверНужна видеокарта
- Сферы
- Медиа и продакшн, Безопасность, Документы и бухгалтерия
Какие задачи решает
- Разбор длинных видео и поиск событий по времени
- Потоковый анализ видео в реальном времени
- Понимание фото и документов
Где применяется
Медиа и видеоархивыВидеонаблюдениеДокументооборот
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
нет версий1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходитКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- MOSS-VL-Realtime
- MOSS-VL 0708 (Base, Instruct)
- MOSS-VL 0408 (Base, Instruct)
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Картинка + текстInternVideoShanghai AI Lab (OpenGVLab) · КитайМожно в коммерцию
Семейство моделей для видео: энкодеры для поиска и классификации роликов и чат-модели, которые разбирают длинные видео. InternVideo 3 рассчитан на многочасовые записи.
ПодробнееКартинка + текстVideoLLaMAAlibaba DAMO Academy · КитайМожно в коммерциюМодели, которые смотрят видео и отвечают на вопросы о нём: что происходит, в какой момент, кто что делает. VideoLLaMA 3 на 2B и 7B — одни из сильнейших в своём размере.
ПодробнееКартинка + текстQwen-VLAlibaba (команда Qwen) · КитайМожно в коммерциюОдна из сильнейших открытых моделей зрения: читает документы, таблицы, графики, видео, работает с интерфейсами. С Qwen3.5 зрение встроено прямо в основную модель Qwen.
Подробнее

