КартинкиGGUF2025–2026
Alibaba · Китай
Генерация и редактирование картинок, в том числе с текстом на изображении. Ранние версии можно в коммерцию, свежая 2.1 — только некоммерческая.
- Инфографика для карточек товаров
- Правка фото по текстовой команде
- Рекламные креативы
- Размеры
- 7B – 20B
- Железо
- от: 1 видеокарта
Речь в текстRUGGUF2025–2026
Microsoft · США
Речевые модели Microsoft: синтез длинных диалогов на несколько голосов, быстрый синтез для живого общения и распознавание длинных записей с разделением по говорящим, в том числе на русском.
- Расшифровка длинных встреч с разметкой говорящих
- Озвучка подкастов и диалогов
- Голос для ассистентов в реальном времени
- Размеры
- 0.5B – 9B
- Железо
- от: Ноутбук
Музыка и звукGGUF2025–2026
M-A-P и HKUST · Китай
Генерация полноценных песен с вокалом и аккомпанементом по тексту и описанию стиля: английский, китайский, японский, корейский.
- Песни и джинглы по тексту
- Демо-версии композиций
- Музыка для роликов
- Размеры
- 0.5B – 7B
- Железо
- от: 1 видеокарта
Музыка и звук2026
HeartMuLa Team · не указана
Открытая модель генерации песен с вокалом на китайском, английском, японском, корейском и испанском, плюс кодек и модель расшифровки текста песен.
- Песни и джинглы по тексту
- Музыка для роликов
- Расшифровка текста песен
- Размеры
- 3B
- Железо
- от: 1 видеокарта
ТекстRUOllama2024–2026
Cohere Labs · Канада
Многоязычные модели исследовательского крыла Cohere, от 23 до 100+ языков. Tiny Aya 2026 года на 3.3B работает на обычном ПК, но только некоммерчески.
- Перевод и переписка на редких языках
- Многоязычный чат-ассистент
- Разбор изображений с текстом (Vision)
- Размеры
- 3.3B – 35B
- Железо
- от: Ноутбук
Детекция подделок2023–2026
Adobe Research и University of Surrey · США
Водяной знак для картинок любого разрешения, сделанный для инициативы Content Authenticity: умеет и ставить метку, и снимать её. Детектор ошибается в обе стороны — вывод проверяет человек.
- Пометка изображений на выходе из своего пайплайна
- Проверка происхождения присланной картинки
- Связка с метаданными о происхождении контента
- Размеры
- варианты моделей Q и P, разная ёмкость метки
- Железо
- от: Ноутбук
ВидеоGGUF2025–2026
Sand AI · Китай
Видео, которое генерируется по кускам друг за другом, поэтому ролик можно продлевать бесконечно. MAGI-2 делает видео сразу со звуком.
- Длинные ролики с продолжением
- Видео со звуком
- Оживление изображений
- Размеры
- 4.5B – 114B-A6B
- Железо
- от: 1 видеокарта
Видео2025–2026
NVIDIA · США
Лёгкая и быстрая видеомодель NVIDIA. Выдаёт 720p-ролики на одной видеокарте, есть версия на 4 шага для быстрой генерации.
- Быстрые ролики для соцсетей
- Массовая генерация видео
- Видео из картинки
- Размеры
- 2B – 5B
- Железо
- от: 1 видеокарта
Синтез речиGGUF2025–2026
bilibili · Китай
Синтез речи с клонированием голоса и точным контролем длительности, удобен для дубляжа видео. Управляет эмоциями отдельно от тембра.
- Дубляж видео с попаданием в тайминг
- Клонирование голоса
- Эмоциональная озвучка
- Размеры
- около 1B – 2B
- Железо
- от: Ноутбук
Детекция подделок2025–2026
University of Michigan · США
Лёгкий детектор сгенерированных картинок, обученный на 2,7 млн примеров почти от 5000 разных генераторов. Ошибается в обе стороны: результат — повод для проверки человеком, а не доказательство.
- Проверка присланных фото и иллюстраций
- Фильтрация ИИ-картинок в потоке контента
- Разметка подозрительных изображений для ручной проверки
- Размеры
- 22M
- Железо
- от: Ноутбук
Детекция подделок2023–2026
University of Wisconsin-Madison · США
Ранний и до сих пор используемый подход: поверх замороженного CLIP обучается простой классификатор, который переносится на незнакомые генераторы. Ошибается в обе стороны — вывод требует проверки человеком.
- Проверка изображений от новых, незнакомых генераторов
- Базовая линия при сравнении детекторов
- Быстрое внедрение проверки без дообучения крупной модели
- Размеры
- линейный классификатор поверх CLIP ViT-L/14
- Железо
- от: Ноутбук
Видео2025–2026
Alibaba · Китай
Генерация видео по тексту и по картинке. Младшая версия запускается на игровой видеокарте. После 2.2 базовые модели открыто не выходят, только прикладные: монтаж (VACE), говорящие персонажи по звуку (S2V), танцы под музыку (Dancer).
- Короткие рекламные ролики
- Оживление фото товара
- Видео для соцсетей
- Размеры
- 1,3B – 14B
- Железо
- от: 1 видеокарта
КартинкиRU2022–2026
Сбер (Kandinsky Lab) · Россия
Российское семейство генерации картинок и видео от Сбера. Хорошо понимает запросы на русском и российский культурный контекст, открыто под MIT.
- Картинки по описанию на русском
- Короткие рекламные ролики из текста или фото
- Редактирование изображений по инструкции
- Размеры
- 2B – 19B
- Железо
- от: 1 видеокарта
Видео2024–2026
Lightricks · Израиль
Быстрая видеомодель, которая с LTX-2 генерирует видео сразу со звуком и речью. Можно управлять камерой и позой, есть облегчённые версии.
- Рекламные ролики со звуком
- Видео из фото товара
- Озвученные сцены для соцсетей
- Размеры
- 2B – 22B
- Железо
- от: 1 видеокарта
Видео2026
MiniMax · Китай
Открытые веса видеомодели Hailuo от MiniMax. Крупная модель на 33B, делает видео по тексту и картинке, но требует нескольких серверных видеокарт.
- Кинематографичные рекламные ролики
- Видео по тексту и картинке
- Сложные сцены с движением
- Размеры
- 33B + кодировщик 32B
- Железо
- от: Кластер
КартинкиGGUF2026
Krea · США
Модель картинок на 12B с упором на реализм без глянцевого «ИИ-вида». Turbo-версия выдаёт 2K-картинку за пару секунд.
- Реалистичные фото для рекламы
- Картинки высокого разрешения
- Дообучение стилей
- Размеры
- 12B
- Железо
- от: 1 видеокарта
Синтез речиRUGGUF2025–2026
Boson AI · США
Выразительный синтез речи и диалогов с клонированием голоса, плюс модели распознавания. Третья версия синтеза поддерживает около 100 языков, включая русский, но некоммерческая.
- Выразительная озвучка роликов
- Озвучка диалогов
- Клонирование голоса
- Размеры
- около 3B – 8B
- Железо
- от: 1 видеокарта
Синтез речиRUGGUF2025–2026
Zyphra · США
Синтез речи с клонированием голоса и тонкой настройкой эмоций, скорости и высоты голоса.
- Клонирование голоса
- Эмоциональная озвучка
- Озвучка роликов
- Размеры
- около 1.6B
- Железо
- от: Ноутбук
Музыка и звукRUGGUF2025–2026
ACE Studio и StepFun · Китай
Быстрая генерация песен с вокалом на 19 языках, включая русский: полная песня за секунды, правка отдельных фрагментов и смена стиля.
- Песни и джинглы для рекламы
- Фоновая музыка для роликов
- Демо-версии композиций
- Размеры
- около 2B – 4B
- Железо
- от: Ноутбук
ВидеоGGUF2025–2026
Zhipu AI (Z.ai) и Университет Цинхуа · Китай
Анимирует персонажа с картинки по движениям из другого видео, в том числе сложные развороты и несколько персонажей. SCAIL-2 работает без промежуточного скелета и умеет заменять персонажа в ролике.
- Перенос движений актёра на персонажа
- Замена персонажа в готовом видео
- Анимация маскотов и иллюстраций
- Размеры
- 14B
- Железо
- от: 1 видеокарта
КартинкиGGUF2025–2026
HiDream.ai · Китай
Открытые модели картинок под MIT: генерация (I1), редактирование по инструкции (E1) и единая модель O1-Image, которая делает и то и другое.
- Генерация картинок по описанию
- Правка изображений словами
- Вариации продуктовых фото
- Размеры
- около 9B – 17B
- Железо
- от: 1 видеокарта
АватарыGGUF2025–2026
Meituan · Китай
Говорящие люди по аудио на базе LongCat-Video. Версия 1.5 доведена до продакшна: стабильные длинные ролики на китайском и английском.
- Видео с ведущим новостей или курса
- Промо-ролики с говорящим персонажем
- Пение и озвучка
- Размеры
- на базе LongCat-Video 13.6B
- Железо
- от: 1 видеокарта
Синтез речиRUGGUF2025–2026
Resemble AI · США
Синтез речи с клонированием голоса и настройкой эмоциональности. Многоязычная версия поддерживает 23 языка, включая русский; Turbo и Flash ускорены для живого диалога.
- Голос для бота и ассистента
- Клонирование фирменного голоса
- Озвучка роликов
- Размеры
- около 350M – 500M
- Железо
- от: Ноутбук
Музыка и звукGGUF2024–2026
Stability AI · Великобритания
Генерация коротких музыкальных фрагментов и звуковых эффектов по описанию. Третья версия разделена на модели для музыки и для звуков.
- Звуковые эффекты для роликов и игр
- Фоновая музыка и джинглы
- Звуки для интерфейсов
- Размеры
- около 0.5B – 2.3B
- Железо
- от: Ноутбук
Обработка фото2023–2026
BRIA AI · Израиль
Удаление фона от BRIA, обучено на лицензированных фото. Мягкие края, волосы, прозрачность. Есть версии для видео. Для бизнеса нужен платный договор.
- Вырезка товара на белый фон
- Фото сотрудников и экспертов без фона
- Удаление фона на видео
- Размеры
- 44M – 220M
- Железо
- от: Ноутбук
Картинка + текстGGUF2025–2026
Kuaishou · Китай
Модели зрения от Kuaishou с упором на короткие видео. Keye-VL-2.0 (30B, активны 3B) хорошо понимает, что и когда происходит в ролике.
- Разбор и описание коротких видео
- Проверка роликов и контента
- Поиск нужного момента в видео
- Размеры
- 8B – 671B-A37B
- Железо
- от: Ноутбук
Обработка фото2025–2026
S-Lab, Наньянский технологический университет · Сингапур
Вырезает человека из видео с точной альфа-маской, включая волосы и края, без зелёного фона. Нужна маска первого кадра, например из SAM.
- Замена фона на видео без хромакея
- Вырезание человека для монтажа и эффектов
- Подготовка роликов для рекламы и соцсетей
- Размеры
- около 35M
- Железо
- от: Ноутбук
Музыка и звук2025–2026
Alibaba Tongyi (FunAudioLLM) · Китай
Генерирует и редактирует звук к видео, тексту или аудио, сначала «рассуждая» о сцене через мультимодальную модель. PrismAudio — следующая версия для звука к видео.
- Звук к видео по сцене
- Редактирование отдельных звуков в дорожке
- Звуковые эффекты по описанию
- Размеры
- размер на карточке не указан
- Железо
- от: 1 видеокарта
Аватары2026
SII-GAIR и Sand.ai · Китай
Генерирует видео с говорящим человеком сразу со звуком: один трансформер обрабатывает текст, видео и аудио. Речь на 7 языках, русского в списке нет. Есть дистиллированные быстрые версии.
- Видео с ведущим по сценарию
- Рекламные ролики с говорящим персонажем
- Обучающие видео с диктором
- Размеры
- 15B
- Железо
- от: 1 видеокарта
КартинкиGGUF2025–2026
Meituan · Китай
Модель генерации и редактирования картинок на 6B от Meituan. Хорошо пишет китайский текст, есть быстрая версия для правок.
- Генерация картинок по описанию
- Правка фото по инструкции
- Визуалы для карточек товаров
- Размеры
- 6B
- Железо
- от: 1 видеокарта
КартинкиGGUF2024–2026
Black Forest Labs · Германия
Генерация картинок от авторов Stable Diffusion. Хорошо рисует текст на изображении и держит композицию.
- Картинки для карточек товаров
- Баннеры и обложки
- Редактирование фото по описанию (Kontext)
- Размеры
- 4B – 32B
- Железо
- от: 1 видеокарта
КартинкиGGUF2024–2026
Tencent · Китай
Модели картинок Tencent. HunyuanImage 3.0 — крупнейшая открытая MoE-модель генерации на 80B, умеет рассуждать над запросом и редактировать по инструкции.
- Сложные сцены по длинному описанию
- Картинки с текстом на китайском и английском
- Редактирование изображений по инструкции
- Размеры
- 1.5B – 80B-A13B
- Железо
- от: 1 видеокарта
КартинкиGGUF2025–2026
Alibaba (Tongyi-MAI) · Китай
Компактная модель на 6B с фотореализмом уровня крупных моделей. Turbo-версия выдаёт картинку за несколько шагов на обычной игровой видеокарте.
- Фотореалистичные рекламные картинки
- Картинки с текстом на английском и китайском
- Массовая генерация визуалов
- Размеры
- 6B
- Железо
- от: 1 видеокарта
Картинки2026
Zhipu AI (Z.ai) · Китай
Гибрид языковой модели на 9B и декодера на 7B. Сильна в картинках с большим количеством текста: постеры, инфографика, слайды.
- Постеры и баннеры с текстом
- Инфографика
- Иллюстрации к презентациям
- Размеры
- 9B + 7B
- Железо
- от: 1 видеокарта
ВидеоGGUF2025–2026
Skywork AI (Kunlun Tech) · Китай
Видеомодели для кинематографичных сцен с людьми. Умеют ролики неограниченной длины, продление видео и говорящих персонажей по аудио.
- Длинные ролики с продолжением
- Видео с одним персонажем по референсу
- Говорящий аватар по голосу
- Размеры
- 1.3B – 19B
- Железо
- от: 1 видеокарта
Аватары2024–2026
Ant Group · Китай
Говорящие аватары от Ant Group: лицо, а с V2 и жесты рук. V3-Flash выдаёт видео за 8 шагов и укладывается в 12 ГБ видеопамяти.
- Видео с ведущим по фото и голосу
- Аватар с жестами для презентаций
- Озвученные персонажи
- Размеры
- до 1.3B
- Железо
- от: 1 видеокарта
Синтез речиRUGGUF2026
Alibaba (Qwen) · Китай
Синтез речи на 10 языках, включая русский: клонирование голоса по 3 секундам, готовые голоса и создание голоса по текстовому описанию.
- Голос для бота и ассистента
- Клонирование фирменного голоса
- Подбор голоса по описанию
- Размеры
- 0.6B – 1.7B
- Железо
- от: Ноутбук
ВидеоGGUF2026
OpenMOSS / MOSI · Китай
Генерирует видео сразу со звуком: речь с синхронными губами, эффекты и окружение в одном проходе. MoE-архитектура на 32B параметров, есть версии 360p и 720p.
- Короткие ролики с речью и звуком по описанию
- Рекламные сцены с диалогами
- Прототипы видео для сторибордов
- Размеры
- 32B-A18B
- Железо
- от: 1 видеокарта
Синтез речиRU2024–2025
Alibaba (Tongyi, FunAudioLLM) · Китай
Синтез речи с клонированием голоса по короткому образцу и потоковой выдачей для живого диалога. Третья версия поддерживает 9 языков, включая русский.
- Голос для бота и ассистента
- Клонирование фирменного голоса
- Озвучка роликов
- Размеры
- 300M – 0.5B
- Железо
- от: Ноутбук
ТекстRUGGUF2024–2025
Vikhr Models · Россия
Русскоязычные дообучения открытых моделей (Mistral, Qwen, Llama) от независимой команды Vikhr: улучшают русский язык, есть компактные версии для обычного ПК. Borealis — аудио-модель для распознавания и понимания русской речи.
- Русскоязычный ассистент на своём ПК или сервере
- Ответы по базе знаний (RAG)
- Тексты и письма на русском
- Размеры
- 0.5B – 24B
- Железо
- от: Ноутбук
Детекция подделок2024–2025
Meta · США
Водяной знак для видео и картинок, устойчивый к перекодированию и обрезке. Детектор ошибается в обе стороны: отсутствие метки не доказывает подделку, а её находка — повод для проверки человеком.
- Пометка видео, созданного или обработанного ИИ
- Поиск своей метки в перезалитых роликах
- Защита рекламных материалов от переприсвоения
- Размеры
- метка от 96 до 1024 бит
- Железо
- от: Ноутбук
ВидеоGGUF2024–2025
Tencent · Китай
Видеомодель Tencent, одна из первых открытых на уровне закрытых сервисов. Версия 1.5 стала легче (8.3B) и идёт на потребительских картах.
- Видео по текстовому сценарию
- Оживление изображений
- База для дообучения своих видеомоделей
- Размеры
- 8.3B – 13B
- Железо
- от: 1 видеокарта
Синтез речи2025
Nari Labs · Южная Корея
Модель, которая озвучивает целые диалоги на два голоса со смехом, вздохами и паузами. Только английский.
- Озвучка диалогов и подкастов
- Рекламные ролики с живой речью
- Сценки для обучения
- Размеры
- 1B – 2B
- Железо
- от: Ноутбук
Видео2025
Character.AI · США
Генерирует видео вместе со звуком и речью по тексту или картинке: две ветви (видео на базе Wan 2.2 и аудио 5B) работают синхронно. Нужно 24–32 ГБ видеопамяти.
- Короткие ролики с говорящими персонажами
- Оживление картинки с озвучкой
- Прототипы рекламных сцен
- Размеры
- 11B
- Железо
- от: 1 видеокарта
ВидеоGGUF2025
Meituan · Китай
Видеомодель на 13.6B: из текста, из картинки и продолжение видео. Держит качество на роликах в несколько минут.
- Длинные ролики
- Видео из фото
- Продолжение готового видео
- Размеры
- 13.6B
- Железо
- от: 1 видеокарта
Музыка и звук2025
ASLP-lab (Северо-Западный политехнический университет) · Китай
Быстрая генерация полной песни с вокалом по тексту и образцу стиля, до нескольких минут звучания.
- Песни и джинглы по тексту
- Музыка для роликов
- Демо-версии композиций
- Размеры
- около 1.1B
- Железо
- от: Ноутбук
ТекстRU2025
Авито Тех · Россия
Модель Авито на базе Qwen3-8B, переученная под русский язык: свой токенизатор, русские тексты быстрее на 15–25%. Умеет вызывать функции.
- Описания товаров и объявлений на русском
- Чат-бот с вызовом внутренних сервисов
- Разбор и классификация обращений
- Размеры
- 7.9B
- Железо
- от: Ноутбук
Картинка + текстRU2025
Авито Тех · Россия
Русскоязычная модель Авито, которая понимает картинки: описывает фото, отвечает на вопросы по изображению, читает надписи. Основа Qwen2.5-VL, на русском быстрее исходной.
- Описание товара по фото на русском
- Проверка, что фото совпадает с описанием
- Чтение брендов и надписей на картинках
- Размеры
- 7.4B
- Железо
- от: 1 видеокарта
Музыка и звук2025
Tencent Hunyuan · Китай
Генерирует звук студийного качества (48 кГц) к видео по картинке и текстовой подсказке: шаги, удары, окружение, синхронно с действием в кадре.
- Фоли и звуковые эффекты к видео
- Озвучка ИИ-роликов для рекламы
- Саунд-дизайн для коротких видео
- Размеры
- не указан в карточке (веса около 10 ГБ; XL-версия с выгрузкой в память)
- Железо
- от: 1 видеокарта
Аватары2025
Meituan · Китай
Дубляж и говорящие персонажи на базе Wan: MultiTalk ведёт диалог нескольких людей, InfiniteTalk переозвучивает видео любой длины с мимикой и телом.
- Дубляж видео с подгонкой мимики
- Диалог двух персонажей по аудио
- Длинные ролики с ведущим
- Размеры
- 14B
- Железо
- от: 1 видеокарта
Обработка фотоGGUF2024–2025
Нанькайский университет · Китай
Открытая модель точного выделения объекта и удаления фона под лицензией MIT. На ней построен RMBG-2.0. Есть версии для 2K и для волос и полупрозрачных краёв.
- Удаление фона с фото товаров потоком
- Точные маски для дизайна и печати
- Вырезка людей с волосами для рекламы
- Размеры
- около 220M (есть облегчённые lite)
- Железо
- от: Ноутбук
Голос: спикеры и звукRU2023–2025
Сообщество (xbgoose и др.), датасет Dusha от SberDevices · Россия
Модели, определяющие эмоцию по голосу в русской речи: нейтрально, злость, позитив, грусть. Обучены на открытом датасете Dusha от SberDevices.
- Поиск звонков с раздражённым клиентом
- Оценка тона разговоров операторов
- Приоритизация жалоб в колл-центре
- Размеры
- 21M – 316M
- Железо
- от: Ноутбук
Детекция подделок2024–2025
Meta · США
Водяной знак для картинок, который можно поставить на отдельные участки: модель показывает, какая часть изображения помечена. Ошибается в обе стороны — итог проверяет человек.
- Пометка сгенерированных и отредактированных изображений
- Поиск помеченного фрагмента в коллаже
- Отслеживание, какие части картинки сделал ИИ
- Размеры
- кодировщик и декодировщик метки для изображений
- Железо
- от: Ноутбук
КартинкиGGUF2024–2025
BAAI (Пекинская академия ИИ) · Китай
Универсальная модель: генерирует, редактирует, переносит объект или человека с фото в новую сцену без отдельных плагинов.
- Перенос товара или человека в новую сцену
- Редактирование фото по инструкции
- Генерация по нескольким референсам
- Размеры
- около 4B
- Железо
- от: 1 видеокарта
ПереводRUGGUF2024–2025
Unbabel · Португалия
Языковые модели, заточенные под перевод и работу с многоязычными текстами: перевод, правка, оценка качества перевода. Русский есть. Некоммерческая лицензия.
- Перевод с учётом контекста и терминов
- Редактура машинного перевода
- Оценка качества готового перевода
- Размеры
- 2B – 72B
- Железо
- от: Ноутбук
Аватары2025
ByteDance · Китай
Подгоняет движения губ на готовом видео под новую озвучку. Версия 1.6 работает в 512 пикселей и даёт более чёткое лицо.
- Переозвучка роликов на другой язык с попаданием в губы
- Правка реплик в готовом видео без пересъёмки
- Говорящие аватары для обучающих курсов
- Размеры
- нужно 8–18 ГБ видеопамяти
- Железо
- от: Ноутбук
Детекция подделок2024–2025
Xiaohongshu, USTC и Shanghai Jiao Tong University · Китай
Детектор ИИ-картинок из нескольких экспертов: одни смотрят на визуальные артефакты, другие на шум. Вместе с ним выпущен сложный набор Chameleon. Ошибается в обе стороны — итог проверяет человек.
- Проверка реалистичных ИИ-изображений без явных артефактов
- Сравнение детекторов на сложных примерах
- Дообучение под свой тип контента
- Размеры
- несколько экспертов на базе ConvNeXt и CLIP
- Железо
- от: 1 видеокарта
АватарыGGUF2025
Tencent · Китай
Говорящие персонажи на базе HunyuanVideo: передаёт эмоции голоса, работает с несколькими персонажами и разными стилями.
- Видео с ведущим по фото и аудио
- Сцены с несколькими говорящими
- Мультяшные персонажи
- Размеры
- около 13B
- Железо
- от: 1 видеокарта
ТекстRUGGUF2023–2025
Илья Гусев (IlyaGusev) · Россия
Самая известная русскоязычная доучка сообщества: чужие открытые модели (Llama, Mistral, Gemma, YandexGPT) дообучены отвечать на русском как ассистент. Удобная отправная точка для русского чат-бота на своём сервере.
- Чат-ассистент на русском языке
- Ответы на вопросы по базе знаний компании
- Черновики писем, описаний и постов на русском
- Размеры
- 7B – 70B
- Железо
- от: Ноутбук
КартинкиGGUF2024–2025
NVIDIA · США
Быстрая модель картинок от NVIDIA: 4K-изображения за секунды и работа даже на ноутбучной видеокарте. Версия Sprint генерирует в 1–2 шага.
- Массовая генерация картинок
- Визуалы высокого разрешения
- Генерация в реальном времени в приложениях
- Размеры
- 0.6B – 4.8B
- Железо
- от: Ноутбук
Видео2024–2025
HPC-AI Tech · Сингапур
Полностью открытый проект видеогенерации: веса, код и рецепт обучения. Версия 2.0 на 11B делает видео из текста и из картинки.
- Видео по текстовому описанию
- Оживление картинок
- Обучение своей видеомодели
- Размеры
- до 11B
- Железо
- от: 1 видеокарта
Лица2025
ByteDance · Китай
Генерация картинок с сохранением лица на базе FLUX: лучше следует описанию и реже копирует лицо как наклейку. Лицензия только исследовательская.
- Портреты по одному фото с точным описанием сцены
- Тесты персонажей для рекламы
- Сравнение методов сохранения лица
- Размеры
- адаптер к FLUX.1-dev
- Железо
- от: 1 видеокарта
Примерка одежды2025
Пекинский университет почты и связи и др. · Китай
Универсальный набор для одежды на базе FLUX: примерка, генерация модели в заданной вещи и «снятие» вещи с человека в отдельное фото товара.
- Примерка по фото товара
- Фото модели в вещи по текстовому описанию
- Чистое фото вещи со снимка человека
- Размеры
- дополнения (LoRA) к FLUX.1 dev 12B
- Железо
- от: 1 видеокарта
Обработка фото2024–2025
Prama LLC · США
Модель удаления фона с упором на сложные края: волосы, мех, тонкие детали. Открытая версия под MIT, умеет обрабатывать видео.
- Вырезка товара и людей с фото
- Удаление фона на видео
- Подготовка фото для каталога
- Размеры
- около 95M
- Железо
- от: Ноутбук
Картинка + текстGGUF2024–2025
DeepSeek · Китай
Одна модель и понимает картинки, и рисует их по описанию. Janus-Pro-7B была заметна в начале 2025 года, но по качеству картинок уступает специализированным моделям.
- Ответы на вопросы по картинкам
- Черновые иллюстрации по описанию
- Эксперименты с единой моделью зрения и генерации
- Размеры
- 1B – 7B
- Железо
- от: Ноутбук
Разбор текстаRUOllama2024–2025
Jina AI · Германия
Маленькие модели, которые превращают сырой HTML веб-страниц в чистый Markdown или JSON. Удобно готовить сайты для базы знаний. Лицензия только некоммерческая.
- Очистка страниц сайтов для базы знаний
- Извлечение данных со страниц в JSON
- Подготовка текстов для RAG
- Размеры
- 0.5B – 1.5B
- Железо
- от: Ноутбук
Проверка фактов и оценка ответов2025
Atla · Великобритания
Модель-судья на 8B: оценивает ответ другой модели по вашим критериям и пишет обоснование. Судья сам ошибается, на важных задачах ручную проверку он не заменяет.
- Оценка ответов чат-бота по своим критериям
- Сравнение двух версий подсказки или модели
- Отбраковка слабых ответов перед отправкой человеку
- Размеры
- 8B
- Железо
- от: 1 видеокарта
Детекция подделок2024
Meta · США
Незаметная метка в синтезированной речи и быстрый детектор, который находит её даже в куске длинной записи. Детектор ошибается в обе стороны: срабатывание — повод для проверки человеком, а не доказательство.
- Пометка речи, синтезированной вашим сервисом
- Поиск своей метки в чужих публикациях
- Проверка, не подмешан ли синтез в запись разговора
- Размеры
- генератор и детектор водяного знака, 16 бит сообщения
- Железо
- от: Ноутбук
Видео2024
Zhipu AI (Z.ai) и Университет Цинхуа · Китай
Модель видео на 2–5B, которая запускается на одной игровой видеокарте. Популярная база для исследований и надстроек.
- Короткие ролики из текста
- Оживление изображений
- Эксперименты с дообучением видео
- Размеры
- 2B – 5B
- Железо
- от: 1 видеокарта
Синтез речиGGUF2024
Hugging Face · США
Синтез речи, где голос задаётся текстовым описанием («спокойный женский голос, чистая запись»). Английский и 8 европейских языков, русского нет.
- Подбор голоса по описанию
- Озвучка роликов
- Прототипы голосовых сервисов
- Размеры
- 880M – 2.2B
- Железо
- от: Ноутбук
ТекстRU2024
МТС AI (MWS AI) · Россия
Лёгкая русскоязычная модель от МТС AI для текстов на русском: ответы, пересказ, черновики. Есть готовая версия для процессора без видеокарты. Старшая Cotype Pro открыто не выложена.
- Черновики писем и описаний на русском
- Краткий пересказ документов
- Ответы на типовые вопросы клиентов
- Размеры
- 1.5B
- Железо
- от: Ноутбук
КартинкиGGUF2022–2024
Stability AI · Великобритания
Модель, с которой началась открытая генерация картинок. Огромная экосистема дообучений, стилей и плагинов, работает даже на домашнем ПК. Популярные ускорители SDXL-Lightning и Hyper-SD сделала ByteDance.
- Иллюстрации и баннеры для рекламы
- Фоны и сцены для карточек товаров
- Дообучение под фирменный стиль
- Размеры
- 0.9B – 8B
- Железо
- от: Ноутбук
ВидеоGGUF2024
Genmo · США
Открытая видеомодель на 10B с реалистичным движением. На момент выхода была одной из сильнейших открытых, сейчас обновлений нет.
- Видео по описанию
- Короткие рекламные сцены
- Размеры
- 10B
- Железо
- от: 1 видеокарта
Лица2024
ByteDance · Китай
Сохраняет лицо человека при генерации картинок по одному фото и меньше портит стиль и фон. Есть версии для SDXL и FLUX, вторая идёт на карте 16 ГБ.
- Портреты и аватары по одному фото
- Персонажи для рекламы с узнаваемым лицом
- Прототипы фотосессий
- Размеры
- адаптеры к SDXL и FLUX.1-dev
- Железо
- от: 1 видеокарта
Видео2022–2024
hzwer (Хуан Чжэвэй) и соавторы · Китай
Дорисовывает промежуточные кадры: превращает 24–30 кадров в секунду в 60 и больше и делает плавное замедление. Версии 4.24+ хорошо сглаживают видео от генеративных моделей.
- Повышение частоты кадров видео
- Плавное замедленное видео
- Сглаживание роликов от ИИ-генераторов
- Размеры
- лёгкая модель (размер в карточке не указан)
- Железо
- от: Ноутбук
Финансы2023–2024
AI4Finance Foundation · США
Открытый набор лёгких надстроек к обычным языковым моделям для работы с финансовыми текстами и новостями. Не инвестиционная рекомендация: решения принимает специалист.
- Оценка тона финансовых новостей и отчётов
- Разметка упоминаний компаний и инструментов в тексте
- Подготовка сводок по потоку деловых новостей
- Размеры
- адаптеры к базовым моделям 6B – 20B
- Железо
- от: 1 видеокарта
Обработка фото2024
Jasper AI · США
Дополнение к FLUX для увеличения маленьких и размытых картинок с дорисовкой деталей. Популярно, но под некоммерческой лицензией FLUX dev.
- Увеличение мелких картинок с дорисовкой
- Улучшение сгенерированных изображений
- Пилоты апскейла для каталога
- Размеры
- дополнение к FLUX.1 dev 12B
- Железо
- от: 1 видеокарта
КартинкиНе развивается2023–2024
Лвминь Чжан (Стэнфорд) и сообщество · США
Надстройка над моделями картинок: задаёт позу, контуры, глубину или планировку, чтобы результат точно повторял нужную композицию.
- Картинка по эскизу или контуру
- Сохранение позы и композиции
- Визуализация интерьеров по планировке
- Размеры
- 0.4B – 1.3B
- Железо
- от: Ноутбук
ВидеоНе развивается2023–2024
Shanghai AI Lab и CUHK · Китай
Модуль, который оживляет модели картинок Stable Diffusion и превращает их в короткую анимацию. Одна из первых открытых видеотехнологий.
- Короткие анимации в фирменном стиле
- Живые обложки и баннеры
- Анимированные стикеры
- Размеры
- модуль движения поверх SD 1.5 / SDXL
- Железо
- от: Ноутбук
АватарыНе развивается2024
Kuaishou (Kling) · Китай
Оживляет портрет по видео-образцу: мимика и повороты головы переносятся с актёра на фото. Быстро работает даже на слабой видеокарте.
- Оживление портретов
- Перенос мимики актёра на персонажа
- Анимация маскотов
- Размеры
- меньше 1B
- Железо
- от: Ноутбук
Обработка фотоНе развивается2023–2024
Shanghai AI Laboratory (OpenMMLab) и Университет Цинхуа · Китай
Универсальная дорисовка фото: убрать объект, вставить новый по описанию, заменить форму или расширить кадр за края.
- Удаление и замена объектов на фото
- Расширение кадра под нужный формат
- Вставка товара или детали по текстовому описанию
- Размеры
- на базе SD 1.5
- Железо
- от: Ноутбук
Обработка фотоНе развивается2024
Лвмин Чжан (автор ControlNet) · США
Меняет освещение на фото: ставит объект или человека в новый свет по описанию или под заданный фон, чтобы вырезка смотрелась естественно.
- Подгонка света товара под новый фон
- Студийный свет для портретов без пересъёмки
- Единый стиль освещения в каталоге
- Размеры
- на базе SD 1.5
- Железо
- от: Ноутбук
КартинкиНе развивается2023–2024
Huawei Noah's Ark Lab и партнёры · Китай
Компактная модель картинок на 0.6B с качеством уровня крупных. Умеет 4K в версии Sigma, подходит для скромного железа.
- Иллюстрации для статей и соцсетей
- Фоны для карточек товаров
- Быстрые черновики визуалов
- Размеры
- 0.6B
- Железо
- от: Ноутбук
Голос: спикеры и звукНе развивается2024
MyShell и MIT · США
Мгновенное клонирование голоса по короткому образцу с управлением эмоцией и акцентом, V2 говорит на нескольких языках. Использовать только с согласия владельца голоса.
- Озвучка роликов голосом диктора компании
- Голосовой бот с узнаваемым голосом бренда
- Перенос тембра на готовый синтез речи
- Размеры
- менее 1B
- Железо
- от: Ноутбук
ЛицаНе развивается2023–2024
Tencent AI Lab (h94) · Китай
Один из первых адаптеров, которые переносят лицо с фото в сгенерированную картинку. Версии для SD 1.5 идут на слабых картах, но веса некоммерческие.
- Портреты по фото в разных стилях
- Серии картинок с одним персонажем
- Эксперименты с аватарами
- Размеры
- адаптеры к SD 1.5 и SDXL
- Железо
- от: Ноутбук
КартинкиНе развивается2023–2024
Playground AI · США
Модель на архитектуре SDXL с упором на эстетику: яркие цвета, контраст, портреты. Совместима с инструментами экосистемы SDXL.
- Эстетичные рекламные визуалы
- Портреты и лайфстайл-картинки
- Обложки для постов
- Размеры
- около 2.6B
- Железо
- от: 1 видеокарта
ЛицаНе развивается2024
InstantX (Xiaohongshu) · Китай
Генерирует картинки с лицом конкретного человека по одному фото, без дообучения. Популярен в ComfyUI, но веса только для исследований.
- Портреты в разных стилях по одному фото
- Эскизы аватаров и персонажей
- Прототипы фотосессий
- Размеры
- адаптер к SDXL
- Железо
- от: 1 видеокарта
ВидеоНе развивается2023
Stability AI · Великобритания
Первая открытая модель Stability AI для видео: оживляет фото в ролик на 2–4 секунды. Сейчас уступает новым моделям по качеству.
- Оживление фото товара
- Короткие видеозаставки
- Анимация иллюстраций
- Размеры
- около 1.5B
- Железо
- от: 1 видеокарта
Музыка и звукНе развивается2023
LAION · Германия
Аналог CLIP для звука: переводит аудио и текст в общее пространство. Можно искать звуки и музыку по описанию и классифицировать их без обучения. Текст — английский.
- Поиск звуков и музыки по описанию
- Автоматические теги для аудиотеки
- Распознавание типа звука (сирена, стекло, голос)
- Размеры
- размер на карточке не указан
- Железо
- от: Ноутбук
АватарыНе развивается2023
Сианьский университет Цзяотун и Tencent AI Lab · Китай
Старая лёгкая модель говорящей головы: одно фото и аудио превращаются в видео. Работает на слабом железе, но качество заметно ниже новых.
- Говорящее фото для приветствия
- Простые озвученные аватары
- Размеры
- меньше 1B
- Железо
- от: Ноутбук
ТекстRUGGUFНе развивается2023
Сбер (ai-forever) · Россия
Базовая русскоязычная модель Сбера на 13 млрд параметров, из дообученной версии которой вырос GigaChat. Продолжает тексты на русском и английском, контекст всего 2048 токенов; сегодня интересна как основа для узкого дообучения.
- Основа для дообучения под узкую русскую задачу
- Генерация шаблонных русских текстов
- Эксперименты с русскоязычными моделями без ограничений лицензии
- Размеры
- 13B
- Железо
- от: 1 видеокарта
Синтез речиRUGGUFНе развивается2023
Suno · США
Одна из первых открытых моделей, которая озвучивает текст с интонациями, смехом и паузами. Поддерживает около десятка языков, включая русский. Сейчас устарела.
- Черновая озвучка роликов
- Прототипы голосовых сервисов
- Звуковые эффекты в речи
- Размеры
- около 300M – 1B
- Железо
- от: Ноутбук
Разбор текстаRUНе развивается2022–2023
Давид Дале (cointegrated) и сообщество · Россия
Готовые крошечные модели на rubert-tiny для русского текста: находят грубость и оскорбления, определяют тональность и эмоции. Работают на процессоре за миллисекунды.
- Фильтр оскорблений в чатах и комментариях на русском
- Разметка отзывов на позитив, нейтрал и негатив
- Поиск раздражённых клиентов в обращениях
- Размеры
- 12M – 29M
- Железо
- от: Ноутбук