Нейросети для маркетинга и контента

Маркетологам открытые модели пишут тексты, создают картинки, видео и озвучку для рекламы и соцсетей, помогают анализировать отзывы. Своя модель даёт единый стиль и предсказуемые расходы при большом объёме контента. Главное при выборе: лицензия на коммерческое использование результатов и качество на русском.

В подборке 93 семейства открытых моделей.Обновлено 22.09.2026Открыть весь каталог с фильтрами
КартинкиGGUF2025–2026

Qwen-Image

Alibaba · Китай

Генерация и редактирование картинок, в том числе с текстом на изображении. Ранние версии можно в коммерцию, свежая 2.1 — только некоммерческая.

  • Инфографика для карточек товаров
  • Правка фото по текстовой команде
  • Рекламные креативы
Размеры
7B – 20B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Речь в текстRUGGUF2025–2026

VibeVoice

Microsoft · США

Речевые модели Microsoft: синтез длинных диалогов на несколько голосов, быстрый синтез для живого общения и распознавание длинных записей с разделением по говорящим, в том числе на русском.

  • Расшифровка длинных встреч с разметкой говорящих
  • Озвучка подкастов и диалогов
  • Голос для ассистентов в реальном времени
Размеры
0.5B – 9B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Музыка и звукGGUF2025–2026

YuE

M-A-P и HKUST · Китай

Генерация полноценных песен с вокалом и аккомпанементом по тексту и описанию стиля: английский, китайский, японский, корейский.

  • Песни и джинглы по тексту
  • Демо-версии композиций
  • Музыка для роликов
Размеры
0.5B – 7B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Музыка и звук2026

HeartMuLa

HeartMuLa Team · не указана

Открытая модель генерации песен с вокалом на китайском, английском, японском, корейском и испанском, плюс кодек и модель расшифровки текста песен.

  • Песни и джинглы по тексту
  • Музыка для роликов
  • Расшифровка текста песен
Размеры
3B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
ТекстRUOllama2024–2026

Aya

Cohere Labs · Канада

Многоязычные модели исследовательского крыла Cohere, от 23 до 100+ языков. Tiny Aya 2026 года на 3.3B работает на обычном ПК, но только некоммерчески.

  • Перевод и переписка на редких языках
  • Многоязычный чат-ассистент
  • Разбор изображений с текстом (Vision)
Размеры
3.3B – 35B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Детекция подделок2023–2026

TrustMark

Adobe Research и University of Surrey · США

Водяной знак для картинок любого разрешения, сделанный для инициативы Content Authenticity: умеет и ставить метку, и снимать её. Детектор ошибается в обе стороны — вывод проверяет человек.

  • Пометка изображений на выходе из своего пайплайна
  • Проверка происхождения присланной картинки
  • Связка с метаданными о происхождении контента
Размеры
варианты моделей Q и P, разная ёмкость метки
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ВидеоGGUF2025–2026

MAGI

Sand AI · Китай

Видео, которое генерируется по кускам друг за другом, поэтому ролик можно продлевать бесконечно. MAGI-2 делает видео сразу со звуком.

  • Длинные ролики с продолжением
  • Видео со звуком
  • Оживление изображений
Размеры
4.5B – 114B-A6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Видео2025–2026

SANA-Video

NVIDIA · США

Лёгкая и быстрая видеомодель NVIDIA. Выдаёт 720p-ролики на одной видеокарте, есть версия на 4 шага для быстрой генерации.

  • Быстрые ролики для соцсетей
  • Массовая генерация видео
  • Видео из картинки
Размеры
2B – 5B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Синтез речиGGUF2025–2026

IndexTTS

bilibili · Китай

Синтез речи с клонированием голоса и точным контролем длительности, удобен для дубляжа видео. Управляет эмоциями отдельно от тембра.

  • Дубляж видео с попаданием в тайминг
  • Клонирование голоса
  • Эмоциональная озвучка
Размеры
около 1B – 2B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Детекция подделок2025–2026

Community Forensics

University of Michigan · США

Лёгкий детектор сгенерированных картинок, обученный на 2,7 млн примеров почти от 5000 разных генераторов. Ошибается в обе стороны: результат — повод для проверки человеком, а не доказательство.

  • Проверка присланных фото и иллюстраций
  • Фильтрация ИИ-картинок в потоке контента
  • Разметка подозрительных изображений для ручной проверки
Размеры
22M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Детекция подделок2023–2026

UniversalFakeDetect

University of Wisconsin-Madison · США

Ранний и до сих пор используемый подход: поверх замороженного CLIP обучается простой классификатор, который переносится на незнакомые генераторы. Ошибается в обе стороны — вывод требует проверки человеком.

  • Проверка изображений от новых, незнакомых генераторов
  • Базовая линия при сравнении детекторов
  • Быстрое внедрение проверки без дообучения крупной модели
Размеры
линейный классификатор поверх CLIP ViT-L/14
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Видео2025–2026

Wan

Alibaba · Китай

Генерация видео по тексту и по картинке. Младшая версия запускается на игровой видеокарте. После 2.2 базовые модели открыто не выходят, только прикладные: монтаж (VACE), говорящие персонажи по звуку (S2V), танцы под музыку (Dancer).

  • Короткие рекламные ролики
  • Оживление фото товара
  • Видео для соцсетей
Размеры
1,3B – 14B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
КартинкиRU2022–2026

Kandinsky

Сбер (Kandinsky Lab) · Россия

Российское семейство генерации картинок и видео от Сбера. Хорошо понимает запросы на русском и российский культурный контекст, открыто под MIT.

  • Картинки по описанию на русском
  • Короткие рекламные ролики из текста или фото
  • Редактирование изображений по инструкции
Размеры
2B – 19B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Видео2024–2026

LTX-Video / LTX-2

Lightricks · Израиль

Быстрая видеомодель, которая с LTX-2 генерирует видео сразу со звуком и речью. Можно управлять камерой и позой, есть облегчённые версии.

  • Рекламные ролики со звуком
  • Видео из фото товара
  • Озвученные сцены для соцсетей
Размеры
2B – 22B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Видео2026

MiniMax H3 (Hailuo)

MiniMax · Китай

Открытые веса видеомодели Hailuo от MiniMax. Крупная модель на 33B, делает видео по тексту и картинке, но требует нескольких серверных видеокарт.

  • Кинематографичные рекламные ролики
  • Видео по тексту и картинке
  • Сложные сцены с движением
Размеры
33B + кодировщик 32B
Железо
от: Кластер
Коммерция с условиямиПодробнее
КартинкиGGUF2026

Krea 2

Krea · США

Модель картинок на 12B с упором на реализм без глянцевого «ИИ-вида». Turbo-версия выдаёт 2K-картинку за пару секунд.

  • Реалистичные фото для рекламы
  • Картинки высокого разрешения
  • Дообучение стилей
Размеры
12B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Синтез речиRUGGUF2025–2026

Higgs Audio

Boson AI · США

Выразительный синтез речи и диалогов с клонированием голоса, плюс модели распознавания. Третья версия синтеза поддерживает около 100 языков, включая русский, но некоммерческая.

  • Выразительная озвучка роликов
  • Озвучка диалогов
  • Клонирование голоса
Размеры
около 3B – 8B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Синтез речиRUGGUF2025–2026

Zonos

Zyphra · США

Синтез речи с клонированием голоса и тонкой настройкой эмоций, скорости и высоты голоса.

  • Клонирование голоса
  • Эмоциональная озвучка
  • Озвучка роликов
Размеры
около 1.6B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Музыка и звукRUGGUF2025–2026

ACE-Step

ACE Studio и StepFun · Китай

Быстрая генерация песен с вокалом на 19 языках, включая русский: полная песня за секунды, правка отдельных фрагментов и смена стиля.

  • Песни и джинглы для рекламы
  • Фоновая музыка для роликов
  • Демо-версии композиций
Размеры
около 2B – 4B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ВидеоGGUF2025–2026

SCAIL

Zhipu AI (Z.ai) и Университет Цинхуа · Китай

Анимирует персонажа с картинки по движениям из другого видео, в том числе сложные развороты и несколько персонажей. SCAIL-2 работает без промежуточного скелета и умеет заменять персонажа в ролике.

  • Перенос движений актёра на персонажа
  • Замена персонажа в готовом видео
  • Анимация маскотов и иллюстраций
Размеры
14B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
КартинкиGGUF2025–2026

HiDream

HiDream.ai · Китай

Открытые модели картинок под MIT: генерация (I1), редактирование по инструкции (E1) и единая модель O1-Image, которая делает и то и другое.

  • Генерация картинок по описанию
  • Правка изображений словами
  • Вариации продуктовых фото
Размеры
около 9B – 17B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
АватарыGGUF2025–2026

LongCat-Video-Avatar

Meituan · Китай

Говорящие люди по аудио на базе LongCat-Video. Версия 1.5 доведена до продакшна: стабильные длинные ролики на китайском и английском.

  • Видео с ведущим новостей или курса
  • Промо-ролики с говорящим персонажем
  • Пение и озвучка
Размеры
на базе LongCat-Video 13.6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Синтез речиRUGGUF2025–2026

Chatterbox

Resemble AI · США

Синтез речи с клонированием голоса и настройкой эмоциональности. Многоязычная версия поддерживает 23 языка, включая русский; Turbo и Flash ускорены для живого диалога.

  • Голос для бота и ассистента
  • Клонирование фирменного голоса
  • Озвучка роликов
Размеры
около 350M – 500M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Музыка и звукGGUF2024–2026

Stable Audio

Stability AI · Великобритания

Генерация коротких музыкальных фрагментов и звуковых эффектов по описанию. Третья версия разделена на модели для музыки и для звуков.

  • Звуковые эффекты для роликов и игр
  • Фоновая музыка и джинглы
  • Звуки для интерфейсов
Размеры
около 0.5B – 2.3B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Обработка фото2023–2026

BRIA RMBG

BRIA AI · Израиль

Удаление фона от BRIA, обучено на лицензированных фото. Мягкие края, волосы, прозрачность. Есть версии для видео. Для бизнеса нужен платный договор.

  • Вырезка товара на белый фон
  • Фото сотрудников и экспертов без фона
  • Удаление фона на видео
Размеры
44M – 220M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Картинка + текстGGUF2025–2026

Keye-VL

Kuaishou · Китай

Модели зрения от Kuaishou с упором на короткие видео. Keye-VL-2.0 (30B, активны 3B) хорошо понимает, что и когда происходит в ролике.

  • Разбор и описание коротких видео
  • Проверка роликов и контента
  • Поиск нужного момента в видео
Размеры
8B – 671B-A37B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Обработка фото2025–2026

MatAnyone

S-Lab, Наньянский технологический университет · Сингапур

Вырезает человека из видео с точной альфа-маской, включая волосы и края, без зелёного фона. Нужна маска первого кадра, например из SAM.

  • Замена фона на видео без хромакея
  • Вырезание человека для монтажа и эффектов
  • Подготовка роликов для рекламы и соцсетей
Размеры
около 35M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Музыка и звук2025–2026

ThinkSound / PrismAudio

Alibaba Tongyi (FunAudioLLM) · Китай

Генерирует и редактирует звук к видео, тексту или аудио, сначала «рассуждая» о сцене через мультимодальную модель. PrismAudio — следующая версия для звука к видео.

  • Звук к видео по сцене
  • Редактирование отдельных звуков в дорожке
  • Звуковые эффекты по описанию
Размеры
размер на карточке не указан
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Аватары2026

daVinci-MagiHuman

SII-GAIR и Sand.ai · Китай

Генерирует видео с говорящим человеком сразу со звуком: один трансформер обрабатывает текст, видео и аудио. Речь на 7 языках, русского в списке нет. Есть дистиллированные быстрые версии.

  • Видео с ведущим по сценарию
  • Рекламные ролики с говорящим персонажем
  • Обучающие видео с диктором
Размеры
15B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
КартинкиGGUF2025–2026

LongCat-Image

Meituan · Китай

Модель генерации и редактирования картинок на 6B от Meituan. Хорошо пишет китайский текст, есть быстрая версия для правок.

  • Генерация картинок по описанию
  • Правка фото по инструкции
  • Визуалы для карточек товаров
Размеры
6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
КартинкиGGUF2024–2026

FLUX

Black Forest Labs · Германия

Генерация картинок от авторов Stable Diffusion. Хорошо рисует текст на изображении и держит композицию.

  • Картинки для карточек товаров
  • Баннеры и обложки
  • Редактирование фото по описанию (Kontext)
Размеры
4B – 32B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
КартинкиGGUF2024–2026

Hunyuan Image

Tencent · Китай

Модели картинок Tencent. HunyuanImage 3.0 — крупнейшая открытая MoE-модель генерации на 80B, умеет рассуждать над запросом и редактировать по инструкции.

  • Сложные сцены по длинному описанию
  • Картинки с текстом на китайском и английском
  • Редактирование изображений по инструкции
Размеры
1.5B – 80B-A13B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
КартинкиGGUF2025–2026

Z-Image

Alibaba (Tongyi-MAI) · Китай

Компактная модель на 6B с фотореализмом уровня крупных моделей. Turbo-версия выдаёт картинку за несколько шагов на обычной игровой видеокарте.

  • Фотореалистичные рекламные картинки
  • Картинки с текстом на английском и китайском
  • Массовая генерация визуалов
Размеры
6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Картинки2026

GLM-Image

Zhipu AI (Z.ai) · Китай

Гибрид языковой модели на 9B и декодера на 7B. Сильна в картинках с большим количеством текста: постеры, инфографика, слайды.

  • Постеры и баннеры с текстом
  • Инфографика
  • Иллюстрации к презентациям
Размеры
9B + 7B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
ВидеоGGUF2025–2026

SkyReels

Skywork AI (Kunlun Tech) · Китай

Видеомодели для кинематографичных сцен с людьми. Умеют ролики неограниченной длины, продление видео и говорящих персонажей по аудио.

  • Длинные ролики с продолжением
  • Видео с одним персонажем по референсу
  • Говорящий аватар по голосу
Размеры
1.3B – 19B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Аватары2024–2026

EchoMimic

Ant Group · Китай

Говорящие аватары от Ant Group: лицо, а с V2 и жесты рук. V3-Flash выдаёт видео за 8 шагов и укладывается в 12 ГБ видеопамяти.

  • Видео с ведущим по фото и голосу
  • Аватар с жестами для презентаций
  • Озвученные персонажи
Размеры
до 1.3B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Синтез речиRUGGUF2026

Qwen3-TTS

Alibaba (Qwen) · Китай

Синтез речи на 10 языках, включая русский: клонирование голоса по 3 секундам, готовые голоса и создание голоса по текстовому описанию.

  • Голос для бота и ассистента
  • Клонирование фирменного голоса
  • Подбор голоса по описанию
Размеры
0.6B – 1.7B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ВидеоGGUF2026

MOVA

OpenMOSS / MOSI · Китай

Генерирует видео сразу со звуком: речь с синхронными губами, эффекты и окружение в одном проходе. MoE-архитектура на 32B параметров, есть версии 360p и 720p.

  • Короткие ролики с речью и звуком по описанию
  • Рекламные сцены с диалогами
  • Прототипы видео для сторибордов
Размеры
32B-A18B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Синтез речиRU2024–2025

CosyVoice / Fun-CosyVoice

Alibaba (Tongyi, FunAudioLLM) · Китай

Синтез речи с клонированием голоса по короткому образцу и потоковой выдачей для живого диалога. Третья версия поддерживает 9 языков, включая русский.

  • Голос для бота и ассистента
  • Клонирование фирменного голоса
  • Озвучка роликов
Размеры
300M – 0.5B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ТекстRUGGUF2024–2025

Vikhr

Vikhr Models · Россия

Русскоязычные дообучения открытых моделей (Mistral, Qwen, Llama) от независимой команды Vikhr: улучшают русский язык, есть компактные версии для обычного ПК. Borealis — аудио-модель для распознавания и понимания русской речи.

  • Русскоязычный ассистент на своём ПК или сервере
  • Ответы по базе знаний (RAG)
  • Тексты и письма на русском
Размеры
0.5B – 24B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Детекция подделок2024–2025

VideoSeal

Meta · США

Водяной знак для видео и картинок, устойчивый к перекодированию и обрезке. Детектор ошибается в обе стороны: отсутствие метки не доказывает подделку, а её находка — повод для проверки человеком.

  • Пометка видео, созданного или обработанного ИИ
  • Поиск своей метки в перезалитых роликах
  • Защита рекламных материалов от переприсвоения
Размеры
метка от 96 до 1024 бит
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ВидеоGGUF2024–2025

HunyuanVideo

Tencent · Китай

Видеомодель Tencent, одна из первых открытых на уровне закрытых сервисов. Версия 1.5 стала легче (8.3B) и идёт на потребительских картах.

  • Видео по текстовому сценарию
  • Оживление изображений
  • База для дообучения своих видеомоделей
Размеры
8.3B – 13B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Синтез речи2025

Dia

Nari Labs · Южная Корея

Модель, которая озвучивает целые диалоги на два голоса со смехом, вздохами и паузами. Только английский.

  • Озвучка диалогов и подкастов
  • Рекламные ролики с живой речью
  • Сценки для обучения
Размеры
1B – 2B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Видео2025

Ovi

Character.AI · США

Генерирует видео вместе со звуком и речью по тексту или картинке: две ветви (видео на базе Wan 2.2 и аудио 5B) работают синхронно. Нужно 24–32 ГБ видеопамяти.

  • Короткие ролики с говорящими персонажами
  • Оживление картинки с озвучкой
  • Прототипы рекламных сцен
Размеры
11B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
ВидеоGGUF2025

LongCat-Video

Meituan · Китай

Видеомодель на 13.6B: из текста, из картинки и продолжение видео. Держит качество на роликах в несколько минут.

  • Длинные ролики
  • Видео из фото
  • Продолжение готового видео
Размеры
13.6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Музыка и звук2025

DiffRhythm

ASLP-lab (Северо-Западный политехнический университет) · Китай

Быстрая генерация полной песни с вокалом по тексту и образцу стиля, до нескольких минут звучания.

  • Песни и джинглы по тексту
  • Музыка для роликов
  • Демо-версии композиций
Размеры
около 1.1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ТекстRU2025

A-Vibe (Авито)

Авито Тех · Россия

Модель Авито на базе Qwen3-8B, переученная под русский язык: свой токенизатор, русские тексты быстрее на 15–25%. Умеет вызывать функции.

  • Описания товаров и объявлений на русском
  • Чат-бот с вызовом внутренних сервисов
  • Разбор и классификация обращений
Размеры
7.9B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текстRU2025

A-Vision (Авито)

Авито Тех · Россия

Русскоязычная модель Авито, которая понимает картинки: описывает фото, отвечает на вопросы по изображению, читает надписи. Основа Qwen2.5-VL, на русском быстрее исходной.

  • Описание товара по фото на русском
  • Проверка, что фото совпадает с описанием
  • Чтение брендов и надписей на картинках
Размеры
7.4B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Музыка и звук2025

HunyuanVideo-Foley

Tencent Hunyuan · Китай

Генерирует звук студийного качества (48 кГц) к видео по картинке и текстовой подсказке: шаги, удары, окружение, синхронно с действием в кадре.

  • Фоли и звуковые эффекты к видео
  • Озвучка ИИ-роликов для рекламы
  • Саунд-дизайн для коротких видео
Размеры
не указан в карточке (веса около 10 ГБ; XL-версия с выгрузкой в память)
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Аватары2025

MultiTalk / InfiniteTalk

Meituan · Китай

Дубляж и говорящие персонажи на базе Wan: MultiTalk ведёт диалог нескольких людей, InfiniteTalk переозвучивает видео любой длины с мимикой и телом.

  • Дубляж видео с подгонкой мимики
  • Диалог двух персонажей по аудио
  • Длинные ролики с ведущим
Размеры
14B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Обработка фотоGGUF2024–2025

BiRefNet

Нанькайский университет · Китай

Открытая модель точного выделения объекта и удаления фона под лицензией MIT. На ней построен RMBG-2.0. Есть версии для 2K и для волос и полупрозрачных краёв.

  • Удаление фона с фото товаров потоком
  • Точные маски для дизайна и печати
  • Вырезка людей с волосами для рекламы
Размеры
около 220M (есть облегчённые lite)
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голос: спикеры и звукRU2023–2025

Эмоции в русской речи (модели на датасете Dusha)

Сообщество (xbgoose и др.), датасет Dusha от SberDevices · Россия

Модели, определяющие эмоцию по голосу в русской речи: нейтрально, злость, позитив, грусть. Обучены на открытом датасете Dusha от SberDevices.

  • Поиск звонков с раздражённым клиентом
  • Оценка тона разговоров операторов
  • Приоритизация жалоб в колл-центре
Размеры
21M – 316M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Детекция подделок2024–2025

Watermark Anything (WAM)

Meta · США

Водяной знак для картинок, который можно поставить на отдельные участки: модель показывает, какая часть изображения помечена. Ошибается в обе стороны — итог проверяет человек.

  • Пометка сгенерированных и отредактированных изображений
  • Поиск помеченного фрагмента в коллаже
  • Отслеживание, какие части картинки сделал ИИ
Размеры
кодировщик и декодировщик метки для изображений
Железо
от: Ноутбук
Можно в коммерциюПодробнее
КартинкиGGUF2024–2025

OmniGen

BAAI (Пекинская академия ИИ) · Китай

Универсальная модель: генерирует, редактирует, переносит объект или человека с фото в новую сцену без отдельных плагинов.

  • Перенос товара или человека в новую сцену
  • Редактирование фото по инструкции
  • Генерация по нескольким референсам
Размеры
около 4B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
ПереводRUGGUF2024–2025

Tower

Unbabel · Португалия

Языковые модели, заточенные под перевод и работу с многоязычными текстами: перевод, правка, оценка качества перевода. Русский есть. Некоммерческая лицензия.

  • Перевод с учётом контекста и терминов
  • Редактура машинного перевода
  • Оценка качества готового перевода
Размеры
2B – 72B
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Аватары2025

LatentSync

ByteDance · Китай

Подгоняет движения губ на готовом видео под новую озвучку. Версия 1.6 работает в 512 пикселей и даёт более чёткое лицо.

  • Переозвучка роликов на другой язык с попаданием в губы
  • Правка реплик в готовом видео без пересъёмки
  • Говорящие аватары для обучающих курсов
Размеры
нужно 8–18 ГБ видеопамяти
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Детекция подделок2024–2025

AIDE

Xiaohongshu, USTC и Shanghai Jiao Tong University · Китай

Детектор ИИ-картинок из нескольких экспертов: одни смотрят на визуальные артефакты, другие на шум. Вместе с ним выпущен сложный набор Chameleon. Ошибается в обе стороны — итог проверяет человек.

  • Проверка реалистичных ИИ-изображений без явных артефактов
  • Сравнение детекторов на сложных примерах
  • Дообучение под свой тип контента
Размеры
несколько экспертов на базе ConvNeXt и CLIP
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
АватарыGGUF2025

HunyuanVideo-Avatar

Tencent · Китай

Говорящие персонажи на базе HunyuanVideo: передаёт эмоции голоса, работает с несколькими персонажами и разными стилями.

  • Видео с ведущим по фото и аудио
  • Сцены с несколькими говорящими
  • Мультяшные персонажи
Размеры
около 13B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
ТекстRUGGUF2023–2025

Saiga

Илья Гусев (IlyaGusev) · Россия

Самая известная русскоязычная доучка сообщества: чужие открытые модели (Llama, Mistral, Gemma, YandexGPT) дообучены отвечать на русском как ассистент. Удобная отправная точка для русского чат-бота на своём сервере.

  • Чат-ассистент на русском языке
  • Ответы на вопросы по базе знаний компании
  • Черновики писем, описаний и постов на русском
Размеры
7B – 70B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
КартинкиGGUF2024–2025

SANA

NVIDIA · США

Быстрая модель картинок от NVIDIA: 4K-изображения за секунды и работа даже на ноутбучной видеокарте. Версия Sprint генерирует в 1–2 шага.

  • Массовая генерация картинок
  • Визуалы высокого разрешения
  • Генерация в реальном времени в приложениях
Размеры
0.6B – 4.8B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Видео2024–2025

Open-Sora

HPC-AI Tech · Сингапур

Полностью открытый проект видеогенерации: веса, код и рецепт обучения. Версия 2.0 на 11B делает видео из текста и из картинки.

  • Видео по текстовому описанию
  • Оживление картинок
  • Обучение своей видеомодели
Размеры
до 11B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Лица2025

InfiniteYou

ByteDance · Китай

Генерация картинок с сохранением лица на базе FLUX: лучше следует описанию и реже копирует лицо как наклейку. Лицензия только исследовательская.

  • Портреты по одному фото с точным описанием сцены
  • Тесты персонажей для рекламы
  • Сравнение методов сохранения лица
Размеры
адаптер к FLUX.1-dev
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Примерка одежды2025

Any2AnyTryon

Пекинский университет почты и связи и др. · Китай

Универсальный набор для одежды на базе FLUX: примерка, генерация модели в заданной вещи и «снятие» вещи с человека в отдельное фото товара.

  • Примерка по фото товара
  • Фото модели в вещи по текстовому описанию
  • Чистое фото вещи со снимка человека
Размеры
дополнения (LoRA) к FLUX.1 dev 12B
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Обработка фото2024–2025

BEN2

Prama LLC · США

Модель удаления фона с упором на сложные края: волосы, мех, тонкие детали. Открытая версия под MIT, умеет обрабатывать видео.

  • Вырезка товара и людей с фото
  • Удаление фона на видео
  • Подготовка фото для каталога
Размеры
около 95M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текстGGUF2024–2025

Janus

DeepSeek · Китай

Одна модель и понимает картинки, и рисует их по описанию. Janus-Pro-7B была заметна в начале 2025 года, но по качеству картинок уступает специализированным моделям.

  • Ответы на вопросы по картинкам
  • Черновые иллюстрации по описанию
  • Эксперименты с единой моделью зрения и генерации
Размеры
1B – 7B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Разбор текстаRUOllama2024–2025

ReaderLM (Jina)

Jina AI · Германия

Маленькие модели, которые превращают сырой HTML веб-страниц в чистый Markdown или JSON. Удобно готовить сайты для базы знаний. Лицензия только некоммерческая.

  • Очистка страниц сайтов для базы знаний
  • Извлечение данных со страниц в JSON
  • Подготовка текстов для RAG
Размеры
0.5B – 1.5B
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Проверка фактов и оценка ответов2025

Atla Selene

Atla · Великобритания

Модель-судья на 8B: оценивает ответ другой модели по вашим критериям и пишет обоснование. Судья сам ошибается, на важных задачах ручную проверку он не заменяет.

  • Оценка ответов чат-бота по своим критериям
  • Сравнение двух версий подсказки или модели
  • Отбраковка слабых ответов перед отправкой человеку
Размеры
8B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Детекция подделок2024

AudioSeal

Meta · США

Незаметная метка в синтезированной речи и быстрый детектор, который находит её даже в куске длинной записи. Детектор ошибается в обе стороны: срабатывание — повод для проверки человеком, а не доказательство.

  • Пометка речи, синтезированной вашим сервисом
  • Поиск своей метки в чужих публикациях
  • Проверка, не подмешан ли синтез в запись разговора
Размеры
генератор и детектор водяного знака, 16 бит сообщения
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Видео2024

CogVideoX

Zhipu AI (Z.ai) и Университет Цинхуа · Китай

Модель видео на 2–5B, которая запускается на одной игровой видеокарте. Популярная база для исследований и надстроек.

  • Короткие ролики из текста
  • Оживление изображений
  • Эксперименты с дообучением видео
Размеры
2B – 5B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Синтез речиGGUF2024

Parler-TTS

Hugging Face · США

Синтез речи, где голос задаётся текстовым описанием («спокойный женский голос, чистая запись»). Английский и 8 европейских языков, русского нет.

  • Подбор голоса по описанию
  • Озвучка роликов
  • Прототипы голосовых сервисов
Размеры
880M – 2.2B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ТекстRU2024

Cotype Nano (МТС AI)

МТС AI (MWS AI) · Россия

Лёгкая русскоязычная модель от МТС AI для текстов на русском: ответы, пересказ, черновики. Есть готовая версия для процессора без видеокарты. Старшая Cotype Pro открыто не выложена.

  • Черновики писем и описаний на русском
  • Краткий пересказ документов
  • Ответы на типовые вопросы клиентов
Размеры
1.5B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
КартинкиGGUF2022–2024

Stable Diffusion

Stability AI · Великобритания

Модель, с которой началась открытая генерация картинок. Огромная экосистема дообучений, стилей и плагинов, работает даже на домашнем ПК. Популярные ускорители SDXL-Lightning и Hyper-SD сделала ByteDance.

  • Иллюстрации и баннеры для рекламы
  • Фоны и сцены для карточек товаров
  • Дообучение под фирменный стиль
Размеры
0.9B – 8B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
ВидеоGGUF2024

Mochi

Genmo · США

Открытая видеомодель на 10B с реалистичным движением. На момент выхода была одной из сильнейших открытых, сейчас обновлений нет.

  • Видео по описанию
  • Короткие рекламные сцены
Размеры
10B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Лица2024

PuLID

ByteDance · Китай

Сохраняет лицо человека при генерации картинок по одному фото и меньше портит стиль и фон. Есть версии для SDXL и FLUX, вторая идёт на карте 16 ГБ.

  • Портреты и аватары по одному фото
  • Персонажи для рекламы с узнаваемым лицом
  • Прототипы фотосессий
Размеры
адаптеры к SDXL и FLUX.1-dev
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Видео2022–2024

RIFE (Practical-RIFE)

hzwer (Хуан Чжэвэй) и соавторы · Китай

Дорисовывает промежуточные кадры: превращает 24–30 кадров в секунду в 60 и больше и делает плавное замедление. Версии 4.24+ хорошо сглаживают видео от генеративных моделей.

  • Повышение частоты кадров видео
  • Плавное замедленное видео
  • Сглаживание роликов от ИИ-генераторов
Размеры
лёгкая модель (размер в карточке не указан)
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Финансы2023–2024

FinGPT

AI4Finance Foundation · США

Открытый набор лёгких надстроек к обычным языковым моделям для работы с финансовыми текстами и новостями. Не инвестиционная рекомендация: решения принимает специалист.

  • Оценка тона финансовых новостей и отчётов
  • Разметка упоминаний компаний и инструментов в тексте
  • Подготовка сводок по потоку деловых новостей
Размеры
адаптеры к базовым моделям 6B – 20B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Обработка фото2024

Flux.1-dev ControlNet Upscaler

Jasper AI · США

Дополнение к FLUX для увеличения маленьких и размытых картинок с дорисовкой деталей. Популярно, но под некоммерческой лицензией FLUX dev.

  • Увеличение мелких картинок с дорисовкой
  • Улучшение сгенерированных изображений
  • Пилоты апскейла для каталога
Размеры
дополнение к FLUX.1 dev 12B
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
КартинкиНе развивается2023–2024

ControlNet

Лвминь Чжан (Стэнфорд) и сообщество · США

Надстройка над моделями картинок: задаёт позу, контуры, глубину или планировку, чтобы результат точно повторял нужную композицию.

  • Картинка по эскизу или контуру
  • Сохранение позы и композиции
  • Визуализация интерьеров по планировке
Размеры
0.4B – 1.3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ВидеоНе развивается2023–2024

AnimateDiff

Shanghai AI Lab и CUHK · Китай

Модуль, который оживляет модели картинок Stable Diffusion и превращает их в короткую анимацию. Одна из первых открытых видеотехнологий.

  • Короткие анимации в фирменном стиле
  • Живые обложки и баннеры
  • Анимированные стикеры
Размеры
модуль движения поверх SD 1.5 / SDXL
Железо
от: Ноутбук
Можно в коммерциюПодробнее
АватарыНе развивается2024

LivePortrait

Kuaishou (Kling) · Китай

Оживляет портрет по видео-образцу: мимика и повороты головы переносятся с актёра на фото. Быстро работает даже на слабой видеокарте.

  • Оживление портретов
  • Перенос мимики актёра на персонажа
  • Анимация маскотов
Размеры
меньше 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Обработка фотоНе развивается2023–2024

PowerPaint

Shanghai AI Laboratory (OpenMMLab) и Университет Цинхуа · Китай

Универсальная дорисовка фото: убрать объект, вставить новый по описанию, заменить форму или расширить кадр за края.

  • Удаление и замена объектов на фото
  • Расширение кадра под нужный формат
  • Вставка товара или детали по текстовому описанию
Размеры
на базе SD 1.5
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Обработка фотоНе развивается2024

IC-Light

Лвмин Чжан (автор ControlNet) · США

Меняет освещение на фото: ставит объект или человека в новый свет по описанию или под заданный фон, чтобы вырезка смотрелась естественно.

  • Подгонка света товара под новый фон
  • Студийный свет для портретов без пересъёмки
  • Единый стиль освещения в каталоге
Размеры
на базе SD 1.5
Железо
от: Ноутбук
Можно в коммерциюПодробнее
КартинкиНе развивается2023–2024

PixArt

Huawei Noah's Ark Lab и партнёры · Китай

Компактная модель картинок на 0.6B с качеством уровня крупных. Умеет 4K в версии Sigma, подходит для скромного железа.

  • Иллюстрации для статей и соцсетей
  • Фоны для карточек товаров
  • Быстрые черновики визуалов
Размеры
0.6B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голос: спикеры и звукНе развивается2024

OpenVoice

MyShell и MIT · США

Мгновенное клонирование голоса по короткому образцу с управлением эмоцией и акцентом, V2 говорит на нескольких языках. Использовать только с согласия владельца голоса.

  • Озвучка роликов голосом диктора компании
  • Голосовой бот с узнаваемым голосом бренда
  • Перенос тембра на готовый синтез речи
Размеры
менее 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ЛицаНе развивается2023–2024

IP-Adapter-FaceID

Tencent AI Lab (h94) · Китай

Один из первых адаптеров, которые переносят лицо с фото в сгенерированную картинку. Версии для SD 1.5 идут на слабых картах, но веса некоммерческие.

  • Портреты по фото в разных стилях
  • Серии картинок с одним персонажем
  • Эксперименты с аватарами
Размеры
адаптеры к SD 1.5 и SDXL
Железо
от: Ноутбук
Только некоммерческоеПодробнее
КартинкиНе развивается2023–2024

Playground

Playground AI · США

Модель на архитектуре SDXL с упором на эстетику: яркие цвета, контраст, портреты. Совместима с инструментами экосистемы SDXL.

  • Эстетичные рекламные визуалы
  • Портреты и лайфстайл-картинки
  • Обложки для постов
Размеры
около 2.6B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
ЛицаНе развивается2024

InstantID

InstantX (Xiaohongshu) · Китай

Генерирует картинки с лицом конкретного человека по одному фото, без дообучения. Популярен в ComfyUI, но веса только для исследований.

  • Портреты в разных стилях по одному фото
  • Эскизы аватаров и персонажей
  • Прототипы фотосессий
Размеры
адаптер к SDXL
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
ВидеоНе развивается2023

Stable Video Diffusion

Stability AI · Великобритания

Первая открытая модель Stability AI для видео: оживляет фото в ролик на 2–4 секунды. Сейчас уступает новым моделям по качеству.

  • Оживление фото товара
  • Короткие видеозаставки
  • Анимация иллюстраций
Размеры
около 1.5B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Музыка и звукНе развивается2023

CLAP (LAION)

LAION · Германия

Аналог CLIP для звука: переводит аудио и текст в общее пространство. Можно искать звуки и музыку по описанию и классифицировать их без обучения. Текст — английский.

  • Поиск звуков и музыки по описанию
  • Автоматические теги для аудиотеки
  • Распознавание типа звука (сирена, стекло, голос)
Размеры
размер на карточке не указан
Железо
от: Ноутбук
Можно в коммерциюПодробнее
АватарыНе развивается2023

SadTalker

Сианьский университет Цзяотун и Tencent AI Lab · Китай

Старая лёгкая модель говорящей головы: одно фото и аудио превращаются в видео. Работает на слабом железе, но качество заметно ниже новых.

  • Говорящее фото для приветствия
  • Простые озвученные аватары
Размеры
меньше 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ТекстRUGGUFНе развивается2023

ruGPT-3.5

Сбер (ai-forever) · Россия

Базовая русскоязычная модель Сбера на 13 млрд параметров, из дообученной версии которой вырос GigaChat. Продолжает тексты на русском и английском, контекст всего 2048 токенов; сегодня интересна как основа для узкого дообучения.

  • Основа для дообучения под узкую русскую задачу
  • Генерация шаблонных русских текстов
  • Эксперименты с русскоязычными моделями без ограничений лицензии
Размеры
13B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Синтез речиRUGGUFНе развивается2023

Bark

Suno · США

Одна из первых открытых моделей, которая озвучивает текст с интонациями, смехом и паузами. Поддерживает около десятка языков, включая русский. Сейчас устарела.

  • Черновая озвучка роликов
  • Прототипы голосовых сервисов
  • Звуковые эффекты в речи
Размеры
около 300M – 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Разбор текстаRUНе развивается2022–2023

Русские классификаторы токсичности и тональности

Давид Дале (cointegrated) и сообщество · Россия

Готовые крошечные модели на rubert-tiny для русского текста: находят грубость и оскорбления, определяют тональность и эмоции. Работают на процессоре за миллисекунды.

  • Фильтр оскорблений в чатах и комментариях на русском
  • Разметка отзывов на позитив, нейтрал и негатив
  • Поиск раздражённых клиентов в обращениях
Размеры
12M – 29M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее

Подборки

Нужна модель под вашу задачу?

Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.

  1. ПодберуМодель и размер под задачу и бюджет на железо
  2. ПоставлюНа ваш сервер или в закрытый контур, с API
  3. ДообучуНа ваших данных или подключу базу знаний
  4. ВстроюВ CRM, 1С, бота, сайт или рабочий чат
Обсудить внедрение