Картинка + текстКомпьютерное зрение
InternVideo
Семейство моделей для видео: энкодеры для поиска и классификации роликов и чат-модели, которые разбирают длинные видео. InternVideo 3 рассчитан на многочасовые записи.
- Разработчик
- Shanghai AI Lab (OpenGVLab), Китай
- Первый выпуск
- янв 2023
- Последний выпуск
- июн 2026
- Размеры
- малые энкодеры – 9B
- Лицензия
- Можно в коммерциюApache 2.0 / MIT
- Русский язык
- Нет
- Запуск
- Через свой серверНужна видеокарта
- Сферы
- Медиа и продакшн, Безопасность, Наука
Какие задачи решает
- Поиск по видеоархиву текстовым запросом
- Распознавание действий на видео
- Ответы на вопросы по длинной записи
- Автоматическая разметка роликов
Где применяется
Медиа и видеоархивыВидеонаблюдениеИсследования
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходитКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- InternVideo3-8B
- InternVideo-Next
- InternVideo2.5
- InternVideo2-Chat-8B
- InternVideo2
- InternVideo
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Картинка + текстVideoLLaMAAlibaba DAMO Academy · КитайМожно в коммерцию
Модели, которые смотрят видео и отвечают на вопросы о нём: что происходит, в какой момент, кто что делает. VideoLLaMA 3 на 2B и 7B — одни из сильнейших в своём размере.
ПодробнееКартинка + текстInternVLShanghai AI Laboratory (OpenGVLab) · КитайМожно в коммерциюБольшая линейка китайских моделей зрения с размерами от 1B до 241B. InternVL-U (4B) объединяет понимание картинок, их генерацию и редактирование.
ПодробнееКартинка + текстQwen-VLAlibaba (команда Qwen) · КитайМожно в коммерциюОдна из сильнейших открытых моделей зрения: читает документы, таблицы, графики, видео, работает с интерфейсами. С Qwen3.5 зрение встроено прямо в основную модель Qwen.
Подробнее

