Открытые нейросети для генерации видео

Видеомодели создают короткие ролики по текстовому описанию или оживляют готовую картинку. Их используют для рекламных роликов, контента в соцсети и прототипов сцен. Такие модели требовательны к железу, поэтому заранее смотрите на объём видеопамяти, длину и разрешение ролика, а также на условия лицензии.

В подборке 37 семейств открытых моделей.Обновлено 22.09.2026Открыть весь каталог с фильтрами
ВидеоGGUF2025–2026

MAGI

Sand AI · Китай

Видео, которое генерируется по кускам друг за другом, поэтому ролик можно продлевать бесконечно. MAGI-2 делает видео сразу со звуком.

  • Длинные ролики с продолжением
  • Видео со звуком
  • Оживление изображений
Размеры
4.5B – 114B-A6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Видео2025–2026

SANA-Video

NVIDIA · США

Лёгкая и быстрая видеомодель NVIDIA. Выдаёт 720p-ролики на одной видеокарте, есть версия на 4 шага для быстрой генерации.

  • Быстрые ролики для соцсетей
  • Массовая генерация видео
  • Видео из картинки
Размеры
2B – 5B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Видео2025–2026

Wan

Alibaba · Китай

Генерация видео по тексту и по картинке. Младшая версия запускается на игровой видеокарте. После 2.2 базовые модели открыто не выходят, только прикладные: монтаж (VACE), говорящие персонажи по звуку (S2V), танцы под музыку (Dancer).

  • Короткие рекламные ролики
  • Оживление фото товара
  • Видео для соцсетей
Размеры
1,3B – 14B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
КартинкиRU2022–2026

Kandinsky

Сбер (Kandinsky Lab) · Россия

Российское семейство генерации картинок и видео от Сбера. Хорошо понимает запросы на русском и российский культурный контекст, открыто под MIT.

  • Картинки по описанию на русском
  • Короткие рекламные ролики из текста или фото
  • Редактирование изображений по инструкции
Размеры
2B – 19B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Видео2024–2026

LTX-Video / LTX-2

Lightricks · Израиль

Быстрая видеомодель, которая с LTX-2 генерирует видео сразу со звуком и речью. Можно управлять камерой и позой, есть облегчённые версии.

  • Рекламные ролики со звуком
  • Видео из фото товара
  • Озвученные сцены для соцсетей
Размеры
2B – 22B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Видео2026

MiniMax H3 (Hailuo)

MiniMax · Китай

Открытые веса видеомодели Hailuo от MiniMax. Крупная модель на 33B, делает видео по тексту и картинке, но требует нескольких серверных видеокарт.

  • Кинематографичные рекламные ролики
  • Видео по тексту и картинке
  • Сложные сцены с движением
Размеры
33B + кодировщик 32B
Железо
от: Кластер
Коммерция с условиямиПодробнее
Роботы2025–2026

NVIDIA Cosmos

NVIDIA · США

Модели «мира» для роботов и беспилотников: генерируют реалистичное видео физических сцен и предсказывают действия. Cosmos 3 объединяет понимание, генерацию и управление.

  • Синтетические видео для обучения роботов и беспилотников
  • Проверка сценариев в симуляции
  • Управление роботом (Policy-версии)
Размеры
2B – 65B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
ВидеоGGUF2025–2026

SCAIL

Zhipu AI (Z.ai) и Университет Цинхуа · Китай

Анимирует персонажа с картинки по движениям из другого видео, в том числе сложные развороты и несколько персонажей. SCAIL-2 работает без промежуточного скелета и умеет заменять персонажа в ролике.

  • Перенос движений актёра на персонажа
  • Замена персонажа в готовом видео
  • Анимация маскотов и иллюстраций
Размеры
14B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Обработка фото2023–2026

BRIA RMBG

BRIA AI · Израиль

Удаление фона от BRIA, обучено на лицензированных фото. Мягкие края, волосы, прозрачность. Есть версии для видео. Для бизнеса нужен платный договор.

  • Вырезка товара на белый фон
  • Фото сотрудников и экспертов без фона
  • Удаление фона на видео
Размеры
44M – 220M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
3D2025–2026

HY-World (HunyuanWorld)

Tencent · Китай

Генерация целых 3D-миров и сцен по тексту или картинке, по которым можно ходить. Вторая версия собирает сцену из видео и фото.

  • 3D-сцены для игр и виртуальных туров
  • Фоны и окружение для видеопродакшна
  • Черновики локаций для симуляций
Размеры
набор из нескольких моделей
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Видео2025–2026

Matrix-Game

Skywork AI (Kunlun) · Китай

Интерактивная «модель мира»: генерирует видео игрового мира в реальном времени и реагирует на нажатия клавиш и мышь. Версия 3.0 держит память о сцене минутами.

  • Прототипы игровых миров без движка
  • Интерактивные демо и симуляции
  • Генерация данных для обучения агентов
Размеры
1.8B – 17B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Обработка фото2025–2026

MatAnyone

S-Lab, Наньянский технологический университет · Сингапур

Вырезает человека из видео с точной альфа-маской, включая волосы и края, без зелёного фона. Нужна маска первого кадра, например из SAM.

  • Замена фона на видео без хромакея
  • Вырезание человека для монтажа и эффектов
  • Подготовка роликов для рекламы и соцсетей
Размеры
около 35M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Музыка и звук2025–2026

ThinkSound / PrismAudio

Alibaba Tongyi (FunAudioLLM) · Китай

Генерирует и редактирует звук к видео, тексту или аудио, сначала «рассуждая» о сцене через мультимодальную модель. PrismAudio — следующая версия для звука к видео.

  • Звук к видео по сцене
  • Редактирование отдельных звуков в дорожке
  • Звуковые эффекты по описанию
Размеры
размер на карточке не указан
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Аватары2026

daVinci-MagiHuman

SII-GAIR и Sand.ai · Китай

Генерирует видео с говорящим человеком сразу со звуком: один трансформер обрабатывает текст, видео и аудио. Речь на 7 языках, русского в списке нет. Есть дистиллированные быстрые версии.

  • Видео с ведущим по сценарию
  • Рекламные ролики с говорящим персонажем
  • Обучающие видео с диктором
Размеры
15B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
ВидеоGGUF2025–2026

SkyReels

Skywork AI (Kunlun Tech) · Китай

Видеомодели для кинематографичных сцен с людьми. Умеют ролики неограниченной длины, продление видео и говорящих персонажей по аудио.

  • Длинные ролики с продолжением
  • Видео с одним персонажем по референсу
  • Говорящий аватар по голосу
Размеры
1.3B – 19B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
ВидеоGGUF2026

MOVA

OpenMOSS / MOSI · Китай

Генерирует видео сразу со звуком: речь с синхронными губами, эффекты и окружение в одном проходе. MoE-архитектура на 32B параметров, есть версии 360p и 720p.

  • Короткие ролики с речью и звуком по описанию
  • Рекламные сцены с диалогами
  • Прототипы видео для сторибордов
Размеры
32B-A18B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Детекция подделок2024–2025

VideoSeal

Meta · США

Водяной знак для видео и картинок, устойчивый к перекодированию и обрезке. Детектор ошибается в обе стороны: отсутствие метки не доказывает подделку, а её находка — повод для проверки человеком.

  • Пометка видео, созданного или обработанного ИИ
  • Поиск своей метки в перезалитых роликах
  • Защита рекламных материалов от переприсвоения
Размеры
метка от 96 до 1024 бит
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ВидеоGGUF2024–2025

HunyuanVideo

Tencent · Китай

Видеомодель Tencent, одна из первых открытых на уровне закрытых сервисов. Версия 1.5 стала легче (8.3B) и идёт на потребительских картах.

  • Видео по текстовому сценарию
  • Оживление изображений
  • База для дообучения своих видеомоделей
Размеры
8.3B – 13B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Видео2025

Ovi

Character.AI · США

Генерирует видео вместе со звуком и речью по тексту или картинке: две ветви (видео на базе Wan 2.2 и аудио 5B) работают синхронно. Нужно 24–32 ГБ видеопамяти.

  • Короткие ролики с говорящими персонажами
  • Оживление картинки с озвучкой
  • Прототипы рекламных сцен
Размеры
11B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
ВидеоGGUF2025

LongCat-Video

Meituan · Китай

Видеомодель на 13.6B: из текста, из картинки и продолжение видео. Держит качество на роликах в несколько минут.

  • Длинные ролики
  • Видео из фото
  • Продолжение готового видео
Размеры
13.6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Музыка и звук2025

HunyuanVideo-Foley

Tencent Hunyuan · Китай

Генерирует звук студийного качества (48 кГц) к видео по картинке и текстовой подсказке: шаги, удары, окружение, синхронно с действием в кадре.

  • Фоли и звуковые эффекты к видео
  • Озвучка ИИ-роликов для рекламы
  • Саунд-дизайн для коротких видео
Размеры
не указан в карточке (веса около 10 ГБ; XL-версия с выгрузкой в память)
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Видео2025

Hunyuan-GameCraft

Tencent Hunyuan · Китай

Делает из одной картинки управляемое видео игровой сцены: камера движется по командам клавиатуры. Минимум 24 ГБ видеопамяти, рекомендовано 80 ГБ.

  • Интерактивные видео-прототипы игровых локаций
  • Ролики с проходом камеры по сцене
  • Демо уровней для питчей
Размеры
на базе HunyuanVideo
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Детекция подделок2023–2025

DeepfakeBench

The Chinese University of Hong Kong, Shenzhen (SCLBD) · Китай

Набор из десятков открытых детекторов подмены лица на видео и фото под общим кодом и с готовыми весами. Детектор ошибается в обе стороны: его вывод — повод для проверки человеком, а не доказательство подделки.

  • Первичная проверка присланного видео или селфи
  • Сравнение нескольких детекторов на своих данных
  • Дообучение детектора под свой поток заявок
Размеры
детекторы уровня Xception и EfficientNet, десятки миллионов параметров
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Обработка фото2025

SeedVR / SeedVR2

ByteDance Seed · Китай

Восстановление и увеличение видео и фото от ByteDance. SeedVR2 делает это за один шаг, поэтому заметно быстрее похожих моделей. Коммерческая лицензия.

  • Увеличение фото и видео до 2K–4K
  • Восстановление старых роликов и снимков
  • Улучшение пользовательских фото перед публикацией
Размеры
3B – 7B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Аватары2025

LatentSync

ByteDance · Китай

Подгоняет движения губ на готовом видео под новую озвучку. Версия 1.6 работает в 512 пикселей и даёт более чёткое лицо.

  • Переозвучка роликов на другой язык с попаданием в губы
  • Правка реплик в готовом видео без пересъёмки
  • Говорящие аватары для обучающих курсов
Размеры
нужно 8–18 ГБ видеопамяти
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Примерка одежды2024–2025

CatVTON / CatV2TON

Университет Сунь Ятсена и Pixocial · Китай

Лёгкая модель примерки, запускается на обычной видеокарте. Есть версия без маски и CatV2TON, который примеряет одежду и на видео.

  • Примерка вещи на фото покупателя
  • Черновые карточки товара на модели
  • Примерка на коротком видео
Размеры
899M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Видео2024–2025

Open-Sora

HPC-AI Tech · Сингапур

Полностью открытый проект видеогенерации: веса, код и рецепт обучения. Версия 2.0 на 11B делает видео из текста и из картинки.

  • Видео по текстовому описанию
  • Оживление картинок
  • Обучение своей видеомодели
Размеры
до 11B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Видео2025

Step-Video

StepFun · Китай

Крупная видеомодель на 30B с роликами до 204 кадров. Требует серверного железа, зато открыта под MIT.

  • Видео по описанию
  • Оживление изображений
Размеры
30B
Железо
от: Кластер
Можно в коммерциюПодробнее
Обработка фото2024–2025

BEN2

Prama LLC · США

Модель удаления фона с упором на сложные края: волосы, мех, тонкие детали. Открытая версия под MIT, умеет обрабатывать видео.

  • Вырезка товара и людей с фото
  • Удаление фона на видео
  • Подготовка фото для каталога
Размеры
около 95M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Музыка и звук2024

MMAudio

Иллинойсский университет и Sony AI · США / Япония

Озвучивает немое видео: генерирует шумы и звуковые эффекты, синхронные с происходящим в кадре, по видео и текстовой подсказке. Одна из первых сильных открытых моделей фоли.

  • Звуковые эффекты к немому видео
  • Озвучка роликов от ИИ-генераторов
  • Черновой саунд-дизайн для монтажа
Размеры
размер на карточке не указан
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Видео2024

CogVideoX

Zhipu AI (Z.ai) и Университет Цинхуа · Китай

Модель видео на 2–5B, которая запускается на одной игровой видеокарте. Популярная база для исследований и надстроек.

  • Короткие ролики из текста
  • Оживление изображений
  • Эксперименты с дообучением видео
Размеры
2B – 5B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
ВидеоGGUF2024

Mochi

Genmo · США

Открытая видеомодель на 10B с реалистичным движением. На момент выхода была одной из сильнейших открытых, сейчас обновлений нет.

  • Видео по описанию
  • Короткие рекламные сцены
Размеры
10B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Видео2022–2024

RIFE (Practical-RIFE)

hzwer (Хуан Чжэвэй) и соавторы · Китай

Дорисовывает промежуточные кадры: превращает 24–30 кадров в секунду в 60 и больше и делает плавное замедление. Версии 4.24+ хорошо сглаживают видео от генеративных моделей.

  • Повышение частоты кадров видео
  • Плавное замедленное видео
  • Сглаживание роликов от ИИ-генераторов
Размеры
лёгкая модель (размер в карточке не указан)
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ВидеоНе развивается2023–2024

AnimateDiff

Shanghai AI Lab и CUHK · Китай

Модуль, который оживляет модели картинок Stable Diffusion и превращает их в короткую анимацию. Одна из первых открытых видеотехнологий.

  • Короткие анимации в фирменном стиле
  • Живые обложки и баннеры
  • Анимированные стикеры
Размеры
модуль движения поверх SD 1.5 / SDXL
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ВидеоНе развивается2023

Stable Video Diffusion

Stability AI · Великобритания

Первая открытая модель Stability AI для видео: оживляет фото в ролик на 2–4 секунды. Сейчас уступает новым моделям по качеству.

  • Оживление фото товара
  • Короткие видеозаставки
  • Анимация иллюстраций
Размеры
около 1.5B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Обработка фотоНе развивается2022–2023

InSPyReNet / transparent-background

Ким Тэхун (POSTECH) · Южная Корея

Модель выделения главного объекта и готовая программа transparent-background на её основе: убирает фон с фото, видео и веб-камеры одной командой.

  • Пакетное удаление фона с фото
  • Замена фона на цвет или размытие
  • Удаление фона на видео
Размеры
небольшая (на базе Swin-B)
Железо
от: Ноутбук
Можно в коммерциюПодробнее
АватарыНе развивается2020

Wav2Lip

IIIT Hyderabad · Индия

Классическая модель синхронизации губ с аудио, до сих пор популярна в любительских сборках. Губы точные, но картинка лица размытая, лицензия некоммерческая.

  • Быстрые пробы переозвучки
  • Сравнение с новыми lip-sync моделями
  • Учебные и исследовательские проекты
Размеры
малая модель, лицо 96 пикселей
Железо
от: Ноутбук
Только некоммерческоеПодробнее

Подборки

Нужна модель под вашу задачу?

Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.

  1. ПодберуМодель и размер под задачу и бюджет на железо
  2. ПоставлюНа ваш сервер или в закрытый контур, с API
  3. ДообучуНа ваших данных или подключу базу знаний
  4. ВстроюВ CRM, 1С, бота, сайт или рабочий чат
Обсудить внедрение