Стек под видео: ролик, голос, субтитры, перевод

Ролик собирается из слоёв, и модели работают по слоям так же. Картинка, голос, текст на экране и перевод это четыре независимых задачи, и попытка получить всё одним запросом даёт результат, который нельзя переделать по частям. Когда слои разделены, можно поменять только озвучку или только перевод, не пересобирая видеоряд заново. Для бизнеса это важнее качества отдельного кадра: правки приходят всегда.

Шаг 1. Собрать видеоряд

Модель генерации видео делает короткие сцены по текстовому описанию или оживляет готовую картинку. Реалистично держится обычно несколько секунд, поэтому ролик собирают из коротких кусков, а не просят минуту целиком. Это звено определяет и стоимость, и время: видео считается заметно дольше картинок и требует серьёзной видеокарты. Без него остаётся монтаж из стоков и съёмки.

Чем это делается

Видео2025–2026

Wan

Alibaba · Китай

Генерация видео по тексту и по картинке. Младшая версия запускается на игровой видеокарте. После 2.2 базовые модели открыто не выходят, только прикладные: монтаж (VACE), говорящие персонажи по звуку (S2V), танцы под музыку (Dancer).

  • Короткие рекламные ролики
  • Оживление фото товара
  • Видео для соцсетей
Размеры
1,3B – 14B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
ВидеоGGUF2024–2025

HunyuanVideo

Tencent · Китай

Видеомодель Tencent, одна из первых открытых на уровне закрытых сервисов. Версия 1.5 стала легче (8.3B) и идёт на потребительских картах.

  • Видео по текстовому сценарию
  • Оживление изображений
  • База для дообучения своих видеомоделей
Размеры
8.3B – 13B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Видео2024–2026

LTX-Video / LTX-2

Lightricks · Израиль

Быстрая видеомодель, которая с LTX-2 генерирует видео сразу со звуком и речью. Можно управлять камерой и позой, есть облегчённые версии.

  • Рекламные ролики со звуком
  • Видео из фото товара
  • Озвученные сцены для соцсетей
Размеры
2B – 22B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее

Шаг 2. Озвучить

Синтез речи читает сценарий выбранным голосом, с нужной скоростью и паузами. Здесь решается вопрос узнаваемости: один и тот же голос во всех роликах работает как часть бренда. Клонирование чужого голоса без разрешения человека недопустимо, и это не технический вопрос, а правовой, здесь в общих чертах, конкретный случай смотрит юрист. Без звена нужен диктор на каждую правку текста.

Чем это делается

Синтез речиGGUF2024–2025

F5-TTS

Шанхайский университет Цзяотун и партнёры · Китай

Модель клонирования голоса по нескольким секундам образца, английский и китайский. Сообщество выпустило много дообученных версий под другие языки, в том числе русский.

  • Клонирование голоса
  • Озвучка аудиокниг и роликов
  • Исследования и прототипы
Размеры
около 340M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Синтез речиRU2024–2025

CosyVoice / Fun-CosyVoice

Alibaba (Tongyi, FunAudioLLM) · Китай

Синтез речи с клонированием голоса по короткому образцу и потоковой выдачей для живого диалога. Третья версия поддерживает 9 языков, включая русский.

  • Голос для бота и ассистента
  • Клонирование фирменного голоса
  • Озвучка роликов
Размеры
300M – 0.5B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиRUНе развивается2023

Coqui XTTS

Coqui · Германия

Популярная модель клонирования голоса по короткому образцу на 17 языках, включая русский. Компания Coqui закрылась, развитие остановлено.

  • Клонирование голоса по образцу
  • Озвучка на нескольких языках
  • Исследования и прототипы
Размеры
около 470M
Железо
от: Ноутбук
Только некоммерческоеПодробнее

Шаг 3. Сделать субтитры

Распознавание речи снимает готовую озвучку обратно в текст с отметками времени, и из этого получаются субтитры, которые совпадают со звуком по кадрам. Кажется избыточным, ведь сценарий уже есть, но диктор и синтез читают с паузами, а зритель в ленте смотрит без звука. Без субтитров половина аудитории соцсетей не досматривает ролик до сути.

Чем это делается

Речь в текстRUGGUF2022–2025

Whisper

OpenAI · США

Распознавание речи на 99 языках, включая русский. Стандарт де-факто для расшифровки звонков и встреч. Ускоренные Distil-Whisper от Hugging Face — только для английского.

  • Расшифровка звонков и созвонов
  • Субтитры к видео
  • Голосовые сообщения в текст
Размеры
39M – 1,5B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текстRUGGUF2026

Qwen3-ASR

Alibaba (Qwen) · Китай

Модели распознавания речи от команды Qwen на 50+ языков, включая русский. Хорошо справляются с шумом, пением и акцентами.

  • Расшифровка звонков и встреч
  • Субтитры к видео
  • Распознавание на нескольких языках
Размеры
0.6B – 1.7B
Железо
от: Ноутбук
Можно в коммерциюПодробнее

Шаг 4. Перевести на другие рынки

Модель перевода переносит сценарий и субтитры на другие языки, после чего тот же ролик переозвучивается с шага два. Получается не новая съёмка, а вариант, и стоимость выхода на соседний рынок падает до стоимости озвучки. Без этого звена каждый язык это отдельный производственный цикл со своим подрядчиком и своими сроками.

Чем это делается

ПереводRUGGUF2025

Seed-X

ByteDance Seed · Китай

Компактный переводчик ByteDance на 28 языков, по качеству близкий к крупным закрытым системам. Русский есть. Есть готовые сжатые версии.

  • Перевод деловой переписки и документов
  • Перевод карточек товаров
  • Перевод технических и юридических текстов
Размеры
7B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ПереводRUGGUFНе развивается2022–2023

NLLB-200

Meta · США

Переводчик на 200 языков, включая редкие и малые. Русский есть. Сильна по охвату языков, но лицензия запрещает коммерческое использование.

  • Перевод текстов между 200 языками
  • Перевод на редкие языки, где нет других моделей
  • Сравнение качества при выборе переводчика
Размеры
600M – 3.3B (и 54B MoE)
Железо
от: Ноутбук
Только некоммерческоеПодробнее
ПереводRUGGUF2024–2025

Tower

Unbabel · Португалия

Языковые модели, заточенные под перевод и работу с многоязычными текстами: перевод, правка, оценка качества перевода. Русский есть. Некоммерческая лицензия.

  • Перевод с учётом контекста и терминов
  • Редактура машинного перевода
  • Оценка качества готового перевода
Размеры
2B – 72B
Железо
от: Ноутбук
Только некоммерческоеПодробнее

На что смотреть до внедрения

Ожидания обычно завышены по двум пунктам: длине сцены и управляемости. Модель не выдаёт по описанию нужный кадр с первого раза, и в смету закладывают перебор вариантов, а не один запрос. Заранее договоритесь, где проходит граница: лицо реального человека, чужой бренд в кадре, голос сотрудника. Права на сгенерированное, маркировка синтетического контента и использование чужой внешности здесь описаны в общих чертах, конкретный случай смотрит юрист.

Другие стеки

Нужна модель под вашу задачу?

Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.

  1. ПодберуМодель и размер под задачу и бюджет на железо
  2. ПоставлюНа ваш сервер или в закрытый контур, с API
  3. ДообучуНа ваших данных или подключу базу знаний
  4. ВстроюВ CRM, 1С, бота, сайт или рабочий чат
Обсудить внедрение