Видеомодели создают короткие ролики по текстовому описанию или оживляют готовую картинку. Их используют для рекламных роликов, контента в соцсети и прототипов сцен. Такие модели требовательны к железу, поэтому заранее смотрите на объём видеопамяти, длину и разрешение ролика, а также на условия лицензии.
Генерация видео по тексту и по картинке. Младшая версия запускается на игровой видеокарте. После 2.2 базовые модели открыто не выходят, только прикладные: монтаж (VACE), говорящие персонажи по звуку (S2V), танцы под музыку (Dancer).
Модели «мира» для роботов и беспилотников: генерируют реалистичное видео физических сцен и предсказывают действия. Cosmos 3 объединяет понимание, генерацию и управление.
Синтетические видео для обучения роботов и беспилотников
Анимирует персонажа с картинки по движениям из другого видео, в том числе сложные развороты и несколько персонажей. SCAIL-2 работает без промежуточного скелета и умеет заменять персонажа в ролике.
Интерактивная «модель мира»: генерирует видео игрового мира в реальном времени и реагирует на нажатия клавиш и мышь. Версия 3.0 держит память о сцене минутами.
Генерирует и редактирует звук к видео, тексту или аудио, сначала «рассуждая» о сцене через мультимодальную модель. PrismAudio — следующая версия для звука к видео.
Генерирует видео с говорящим человеком сразу со звуком: один трансформер обрабатывает текст, видео и аудио. Речь на 7 языках, русского в списке нет. Есть дистиллированные быстрые версии.
Генерирует видео сразу со звуком: речь с синхронными губами, эффекты и окружение в одном проходе. MoE-архитектура на 32B параметров, есть версии 360p и 720p.
Водяной знак для видео и картинок, устойчивый к перекодированию и обрезке. Детектор ошибается в обе стороны: отсутствие метки не доказывает подделку, а её находка — повод для проверки человеком.
Генерирует видео вместе со звуком и речью по тексту или картинке: две ветви (видео на базе Wan 2.2 и аудио 5B) работают синхронно. Нужно 24–32 ГБ видеопамяти.
The Chinese University of Hong Kong, Shenzhen (SCLBD) · Китай
Набор из десятков открытых детекторов подмены лица на видео и фото под общим кодом и с готовыми весами. Детектор ошибается в обе стороны: его вывод — повод для проверки человеком, а не доказательство подделки.
Первичная проверка присланного видео или селфи
Сравнение нескольких детекторов на своих данных
Дообучение детектора под свой поток заявок
Размеры
детекторы уровня Xception и EfficientNet, десятки миллионов параметров
Озвучивает немое видео: генерирует шумы и звуковые эффекты, синхронные с происходящим в кадре, по видео и текстовой подсказке. Одна из первых сильных открытых моделей фоли.
Дорисовывает промежуточные кадры: превращает 24–30 кадров в секунду в 60 и больше и делает плавное замедление. Версии 4.24+ хорошо сглаживают видео от генеративных моделей.
Классическая модель синхронизации губ с аудио, до сих пор популярна в любительских сборках. Губы точные, но картинка лица размытая, лицензия некоммерческая.
Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.
ПодберуМодель и размер под задачу и бюджет на железо
ПоставлюНа ваш сервер или в закрытый контур, с API