Нейросети для медиа и продакшна

Для медиа и продакшна открытые модели генерируют видео, музыку и звук, делают субтитры, озвучку и перевод, обрабатывают кадры. Своя инфраструктура снимает ограничения облачных сервисов по объёму и срокам. Внимательно проверьте лицензию на коммерческое использование и требования к видеокартам.

В подборке 181 семейство открытых моделей.Обновлено 22.09.2026Открыть весь каталог с фильтрами
КартинкиGGUF2025–2026

Qwen-Image

Alibaba · Китай

Генерация и редактирование картинок, в том числе с текстом на изображении. Ранние версии можно в коммерцию, свежая 2.1 — только некоммерческая.

  • Инфографика для карточек товаров
  • Правка фото по текстовой команде
  • Рекламные креативы
Размеры
7B – 20B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Речь в текстRUGGUF2025–2026

VibeVoice

Microsoft · США

Речевые модели Microsoft: синтез длинных диалогов на несколько голосов, быстрый синтез для живого общения и распознавание длинных записей с разделением по говорящим, в том числе на русском.

  • Расшифровка длинных встреч с разметкой говорящих
  • Озвучка подкастов и диалогов
  • Голос для ассистентов в реальном времени
Размеры
0.5B – 9B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Музыка и звукGGUF2025–2026

YuE

M-A-P и HKUST · Китай

Генерация полноценных песен с вокалом и аккомпанементом по тексту и описанию стиля: английский, китайский, японский, корейский.

  • Песни и джинглы по тексту
  • Демо-версии композиций
  • Музыка для роликов
Размеры
0.5B – 7B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Музыка и звук2026

HeartMuLa

HeartMuLa Team · не указана

Открытая модель генерации песен с вокалом на китайском, английском, японском, корейском и испанском, плюс кодек и модель расшифровки текста песен.

  • Песни и джинглы по тексту
  • Музыка для роликов
  • Расшифровка текста песен
Размеры
3B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
ТекстRU2022–2026

YandexGPT / AliceAI

Яндекс · Россия

Модели Яндекса, обученные с нуля с упором на русский язык и российские реалии. Новая AliceAI-Foundation 80B-A3B (Apache 2.0) — только базовая модель, инструкт-версии нет: её дообучают под свои задачи. Рядом экономичная AliceAI-T5 35B-A0.6B.

  • Русскоязычный ассистент и чат-бот
  • Ответы на вопросы по базе знаний компании
  • Основа для дообучения под свою отрасль
Размеры
8B – 100B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
3D2024–2026

DUSt3R / MASt3R

NAVER LABS Europe · Франция (NAVER, Южная Корея)

Семейство, с которого началась 3D-реконструкция «в один проход» по паре или набору фото без калибровки камер. MASt3R добавил сопоставление точек и масштаб, MUSt3R и BLASt3R — работу с видео.

  • 3D-сцена по нескольким фото без калибровки
  • Сопоставление точек между снимками
  • Построение карты по видео (SLAM)
Размеры
0.57B – 0.69B
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Музыка и звукGGUF2022–2026

MERT

m-a-p (Multimodal Art Projection) · Великобритания / Китай

Энкодер музыки: превращает трек в числовое описание, по которому определяют жанр, настроение, тональность и ритм. MERT-v2 работает с целыми песнями до 6 минут.

  • Автоматическая разметка музыкального каталога
  • Поиск похожих треков
  • Определение жанра, настроения и темпа
Размеры
95M – 632M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Голосовые ассистенты2026

Samsone

Samsung · Южная Корея

Крошечные модели понимания звука для смартфона: слушают речь, музыку и звуки вокруг и отвечают текстом — описывают запись и отвечают на вопросы о ней. Работают прямо на устройстве, вопросы и ответы — на английском: других языков в обучающих данных нет.

  • Описание аудиозаписи словами
  • Ответы на вопросы о звуке
  • Определение типа звука и обстановки
Размеры
99M – 356M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Детекция подделок2023–2026

TrustMark

Adobe Research и University of Surrey · США

Водяной знак для картинок любого разрешения, сделанный для инициативы Content Authenticity: умеет и ставить метку, и снимать её. Детектор ошибается в обе стороны — вывод проверяет человек.

  • Пометка изображений на выходе из своего пайплайна
  • Проверка происхождения присланной картинки
  • Связка с метаданными о происхождении контента
Размеры
варианты моделей Q и P, разная ёмкость метки
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ВидеоGGUF2025–2026

MAGI

Sand AI · Китай

Видео, которое генерируется по кускам друг за другом, поэтому ролик можно продлевать бесконечно. MAGI-2 делает видео сразу со звуком.

  • Длинные ролики с продолжением
  • Видео со звуком
  • Оживление изображений
Размеры
4.5B – 114B-A6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Компьютерное зрение2024–2026

MoGe

Microsoft Research · США

Восстанавливает 3D-геометрию сцены по одной фотографии: глубину в метрах, облако точек и нормали поверхностей.

  • Замеры помещений и объектов по фото
  • 3D-облако точек из снимка
  • Подготовка данных для роботов и AR
Размеры
ViT-S – ViT-G
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текстGGUF2024–2026

Moonshine

Moonshine AI (Useful Sensors) · США

Очень маленькие и быстрые модели распознавания речи для телефонов, планшетов и встраиваемых устройств. Вторая версия работает потоково и выдаёт текст, пока человек ещё говорит.

  • Голосовое управление устройствами
  • Распознавание на телефоне без интернета
  • Живые субтитры
Размеры
27M – 245M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиGGUF2025–2026

IndexTTS

bilibili · Китай

Синтез речи с клонированием голоса и точным контролем длительности, удобен для дубляжа видео. Управляет эмоциями отдельно от тембра.

  • Дубляж видео с попаданием в тайминг
  • Клонирование голоса
  • Эмоциональная озвучка
Размеры
около 1B – 2B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Текст2024–2026

Hunyuan / Hy

Tencent · Китай

Языковые модели Tencent: от малых 0.5B–7B до Hy4-preview на 770 млрд параметров. С 2026 года линия переименована в Hy, а новые версии вышли под Apache 2.0.

  • Корпоративный ассистент
  • Перевод и работа с многоязычными текстами
  • Агенты с инструментами
Размеры
0.5B – 770B-A49B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Голос: спикеры и звук2022–2026

UVR / MDX-Net / RoFormer (разделение звука)

Сообщество: Ultimate Vocal Remover (Anjok07), ZFTurbo, MVSep · Международное сообщество

Большая открытая коллекция моделей для отделения голоса от музыки и шумов: MDX-Net, BS-RoFormer, Mel-RoFormer, SCNet. Лидеры по качеству вокала среди открытых решений.

  • Чистый голос из записи с музыкой
  • Минусовки и стемы для караоке
  • Удаление фоновой музыки и шума из роликов
Размеры
от десятков до сотен миллионов параметров
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Детекция подделок2025–2026

Community Forensics

University of Michigan · США

Лёгкий детектор сгенерированных картинок, обученный на 2,7 млн примеров почти от 5000 разных генераторов. Ошибается в обе стороны: результат — повод для проверки человеком, а не доказательство.

  • Проверка присланных фото и иллюстраций
  • Фильтрация ИИ-картинок в потоке контента
  • Разметка подозрительных изображений для ручной проверки
Размеры
22M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Детекция подделок2023–2026

UniversalFakeDetect

University of Wisconsin-Madison · США

Ранний и до сих пор используемый подход: поверх замороженного CLIP обучается простой классификатор, который переносится на незнакомые генераторы. Ошибается в обе стороны — вывод требует проверки человеком.

  • Проверка изображений от новых, незнакомых генераторов
  • Базовая линия при сравнении детекторов
  • Быстрое внедрение проверки без дообучения крупной модели
Размеры
линейный классификатор поверх CLIP ViT-L/14
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Видео2025–2026

Wan

Alibaba · Китай

Генерация видео по тексту и по картинке. Младшая версия запускается на игровой видеокарте. После 2.2 базовые модели открыто не выходят, только прикладные: монтаж (VACE), говорящие персонажи по звуку (S2V), танцы под музыку (Dancer).

  • Короткие рекламные ролики
  • Оживление фото товара
  • Видео для соцсетей
Размеры
1,3B – 14B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
КартинкиRU2022–2026

Kandinsky

Сбер (Kandinsky Lab) · Россия

Российское семейство генерации картинок и видео от Сбера. Хорошо понимает запросы на русском и российский культурный контекст, открыто под MIT.

  • Картинки по описанию на русском
  • Короткие рекламные ролики из текста или фото
  • Редактирование изображений по инструкции
Размеры
2B – 19B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
КартинкиGGUF2025–2026

Chroma

lodestones (независимый разработчик) · нет данных

Общественная модель, переобученная из FLUX.1-schnell с упрощённой архитектурой. Без цензуры стилей, популярна как база для дообучения.

  • База для дообучения своих стилей
  • Художественные иллюстрации
  • Картинки для игр
Размеры
4B – 8.9B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Видео2024–2026

LTX-Video / LTX-2

Lightricks · Израиль

Быстрая видеомодель, которая с LTX-2 генерирует видео сразу со звуком и речью. Можно управлять камерой и позой, есть облегчённые версии.

  • Рекламные ролики со звуком
  • Видео из фото товара
  • Озвученные сцены для соцсетей
Размеры
2B – 22B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Видео2026

MiniMax H3 (Hailuo)

MiniMax · Китай

Открытые веса видеомодели Hailuo от MiniMax. Крупная модель на 33B, делает видео по тексту и картинке, но требует нескольких серверных видеокарт.

  • Кинематографичные рекламные ролики
  • Видео по тексту и картинке
  • Сложные сцены с движением
Размеры
33B + кодировщик 32B
Железо
от: Кластер
Коммерция с условиямиПодробнее
Роботы2025–2026

NVIDIA Cosmos

NVIDIA · США

Модели «мира» для роботов и беспилотников: генерируют реалистичное видео физических сцен и предсказывают действия. Cosmos 3 объединяет понимание, генерацию и управление.

  • Синтетические видео для обучения роботов и беспилотников
  • Проверка сценариев в симуляции
  • Управление роботом (Policy-версии)
Размеры
2B – 65B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Голос: спикеры и звук2022–2026

Demucs

Meta AI, затем Александр Дефоссе · Франция

Классическая модель, которая разделяет трек на голос, барабаны, бас и остальное. Версия v4 с гибридным трансформером остаётся эталоном; сейчас проект поддерживает автор в своём репозитории.

  • Отделить голос от музыки в записи
  • Минусовки и дорожки для караоке
  • Очистка речи в видео с фоновой музыкой
Размеры
десятки миллионов параметров
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голос: спикеры и звук2023–2026

RVC (Retrieval-based Voice Conversion)

Сообщество RVC-Project · Китай

Самый массовый открытый инструмент конверсии голоса: модель под конкретный голос учится за 10–30 минут записи, работает в реальном времени. Использовать только с согласия владельца голоса.

  • Озвучка контента одним фирменным голосом
  • Перепевка и работа с вокалом
  • Смена голоса в реальном времени
Размеры
десятки миллионов параметров
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текст2026

MOSS-VL

OpenMOSS (Фуданьский университет) · Китай

Модель «картинка + видео + текст» с упором на длинные видео и точную привязку событий к секундам. Есть версия Realtime для потокового видео в реальном времени.

  • Разбор длинных видео и поиск событий по времени
  • Потоковый анализ видео в реальном времени
  • Понимание фото и документов
Размеры
около 11B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
КартинкиGGUF2026

Krea 2

Krea · США

Модель картинок на 12B с упором на реализм без глянцевого «ИИ-вида». Turbo-версия выдаёт 2K-картинку за пару секунд.

  • Реалистичные фото для рекламы
  • Картинки высокого разрешения
  • Дообучение стилей
Размеры
12B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
КартинкиGGUF2026

Ideogram 4

Ideogram · Канада

Открытые веса модели Ideogram, известной точной типографикой. Под некоммерческой лицензией: для бизнеса подходит только для тестов.

  • Тестирование генерации с текстом
  • Исследования и прототипы
Размеры
около 9B
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Речь в текстRUGGUF2026

Qwen3-ASR

Alibaba (Qwen) · Китай

Модели распознавания речи от команды Qwen на 50+ языков, включая русский. Хорошо справляются с шумом, пением и акцентами.

  • Расшифровка звонков и встреч
  • Субтитры к видео
  • Распознавание на нескольких языках
Размеры
0.6B – 1.7B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текстGGUF2026

Cohere Transcribe

Cohere · Канада

Модель распознавания речи от Cohere на 14 языков (русского в списке нет), отдельная версия для арабского. Рассчитана на точную расшифровку деловых записей.

  • Расшифровка встреч и интервью
  • Субтитры
  • Поиск по аудиоархиву
Размеры
2B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиRUGGUF2025–2026

Higgs Audio

Boson AI · США

Выразительный синтез речи и диалогов с клонированием голоса, плюс модели распознавания. Третья версия синтеза поддерживает около 100 языков, включая русский, но некоммерческая.

  • Выразительная озвучка роликов
  • Озвучка диалогов
  • Клонирование голоса
Размеры
около 3B – 8B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Синтез речиRUGGUF2025–2026

Zonos

Zyphra · США

Синтез речи с клонированием голоса и тонкой настройкой эмоций, скорости и высоты голоса.

  • Клонирование голоса
  • Эмоциональная озвучка
  • Озвучка роликов
Размеры
около 1.6B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Музыка и звукRUGGUF2025–2026

ACE-Step

ACE Studio и StepFun · Китай

Быстрая генерация песен с вокалом на 19 языках, включая русский: полная песня за секунды, правка отдельных фрагментов и смена стиля.

  • Песни и джинглы для рекламы
  • Фоновая музыка для роликов
  • Демо-версии композиций
Размеры
около 2B – 4B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ТекстRUGGUF2025–2026

MiniMax

MiniMax · Китай

Крупные MoE-модели с очень длинным контекстом (до 1 млн токенов у Text-01 и M3). M3 — мультимодальная, понимает картинки. Лицензии сильно различаются от версии к версии.

  • Анализ больших архивов документов за один запрос
  • Агенты с инструментами
  • Помощь программистам
Размеры
230B-A10B – 456B-A46B
Железо
от: Кластер
Коммерция с условиямиПодробнее
Картинка + текст2023–2026

InternVideo

Shanghai AI Lab (OpenGVLab) · Китай

Семейство моделей для видео: энкодеры для поиска и классификации роликов и чат-модели, которые разбирают длинные видео. InternVideo 3 рассчитан на многочасовые записи.

  • Поиск по видеоархиву текстовым запросом
  • Распознавание действий на видео
  • Ответы на вопросы по длинной записи
Размеры
малые энкодеры – 9B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ВидеоGGUF2025–2026

SCAIL

Zhipu AI (Z.ai) и Университет Цинхуа · Китай

Анимирует персонажа с картинки по движениям из другого видео, в том числе сложные развороты и несколько персонажей. SCAIL-2 работает без промежуточного скелета и умеет заменять персонажа в ролике.

  • Перенос движений актёра на персонажа
  • Замена персонажа в готовом видео
  • Анимация маскотов и иллюстраций
Размеры
14B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
КартинкиGGUF2025–2026

HiDream

HiDream.ai · Китай

Открытые модели картинок под MIT: генерация (I1), редактирование по инструкции (E1) и единая модель O1-Image, которая делает и то и другое.

  • Генерация картинок по описанию
  • Правка изображений словами
  • Вариации продуктовых фото
Размеры
около 9B – 17B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
АватарыGGUF2025–2026

LongCat-Video-Avatar

Meituan · Китай

Говорящие люди по аудио на базе LongCat-Video. Версия 1.5 доведена до продакшна: стабильные длинные ролики на китайском и английском.

  • Видео с ведущим новостей или курса
  • Промо-ролики с говорящим персонажем
  • Пение и озвучка
Размеры
на базе LongCat-Video 13.6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
3D2024–2026

TripoSR / TripoSG

VAST (TripoSR — вместе со Stability AI) · Китай

Семейство VAST: 3D-модель по одной фотографии. TripoSR работает меньше секунды, TripoSG даёт более чистую геометрию, TripoSplat строит сцену из гауссовых точек.

  • 3D-модель товара по фото
  • Заготовки объектов для игр и AR
  • Быстрый 3D-прототип для печати
Размеры
до 1.5B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текстRU2023–2026

NVIDIA Parakeet / Canary / Nemotron Speech

NVIDIA · США

Быстрые модели распознавания речи от NVIDIA, в том числе потоковые для работы в реальном времени. Parakeet TDT v3 и Nemotron 3.5 ASR понимают русский.

  • Расшифровка звонков и совещаний
  • Субтитры к видео
  • Голосовой ввод в реальном времени
Размеры
110M – 2.5B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Синтез речиRUGGUF2025–2026

Chatterbox

Resemble AI · США

Синтез речи с клонированием голоса и настройкой эмоциональности. Многоязычная версия поддерживает 23 языка, включая русский; Turbo и Flash ускорены для живого диалога.

  • Голос для бота и ассистента
  • Клонирование фирменного голоса
  • Озвучка роликов
Размеры
около 350M – 500M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиRU2025–2026

MOSS-TTS / MOSS-TTSD

OpenMOSS (Фуданьский университет) · Китай

Семейство синтеза речи: озвучка диалогов на несколько голосов (TTSD), быстрый синтез для живого общения и крошечная Nano. Версия 1.5 поддерживает 30+ языков, включая русский.

  • Озвучка подкастов и диалогов
  • Голос для ассистента
  • Клонирование голоса
Размеры
100M – 8.5B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Музыка и звукGGUF2024–2026

Stable Audio

Stability AI · Великобритания

Генерация коротких музыкальных фрагментов и звуковых эффектов по описанию. Третья версия разделена на модели для музыки и для звуков.

  • Звуковые эффекты для роликов и игр
  • Фоновая музыка и джинглы
  • Звуки для интерфейсов
Размеры
около 0.5B – 2.3B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Обработка фото2023–2026

BRIA RMBG

BRIA AI · Израиль

Удаление фона от BRIA, обучено на лицензированных фото. Мягкие края, волосы, прозрачность. Есть версии для видео. Для бизнеса нужен платный договор.

  • Вырезка товара на белый фон
  • Фото сотрудников и экспертов без фона
  • Удаление фона на видео
Размеры
44M – 220M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Картинка + текстGGUF2025–2026

Keye-VL

Kuaishou · Китай

Модели зрения от Kuaishou с упором на короткие видео. Keye-VL-2.0 (30B, активны 3B) хорошо понимает, что и когда происходит в ролике.

  • Разбор и описание коротких видео
  • Проверка роликов и контента
  • Поиск нужного момента в видео
Размеры
8B – 671B-A37B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиRU2025–2026

Supertonic

Supertone · Южная Корея

Очень быстрый лёгкий синтез речи для работы прямо на устройстве, без видеокарты и облака. Supertonic 3 говорит на 31 языке, включая русский.

  • Озвучка ответов голосового бота на обычном сервере
  • Озвучка в офлайн- и мобильных приложениях
  • Чтение текстов и уведомлений вслух
Размеры
около 99M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
3D2025–2026

VGGT

Meta и Оксфордский университет (VGG) · США / Великобритания

Восстанавливает 3D-сцену по одной, нескольким или сотням фотографий за секунды: положение камер, глубину и облако точек. Лучшая статья CVPR 2025.

  • 3D-модель помещения или объекта по серии фото
  • Определение положения камер для фотограмметрии
  • Облако точек для обмеров и сравнения с планом
Размеры
около 1.2B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Компьютерное зрение2024–2026

Sapiens

Meta · США

Модели Meta для анализа человека на фото: ключевые точки позы, разметка частей тела, нормали и глубина. Sapiens2 обучены на высоком разрешении и добавили маттинг людей.

  • Определение позы и ключевых точек тела
  • Разметка частей тела и одежды
  • Отделение человека от фона
Размеры
0.1B – 5B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Аватары2024–2026

Hallo

Фуданьский университет · Китай

Серия говорящих портретов по аудио: от коротких клипов до часовых видео в 4K. Hallo-Live рассчитана на работу в реальном времени.

  • Видео с ведущим по фото и аудио
  • Длинные обучающие ролики
  • Живой аватар
Размеры
около 1B – 5B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
3D2025–2026

HY-World (HunyuanWorld)

Tencent · Китай

Генерация целых 3D-миров и сцен по тексту или картинке, по которым можно ходить. Вторая версия собирает сцену из видео и фото.

  • 3D-сцены для игр и виртуальных туров
  • Фоны и окружение для видеопродакшна
  • Черновики локаций для симуляций
Размеры
набор из нескольких моделей
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Синтез речиRUGGUF2025–2026

VoxCPM

OpenBMB (ModelBest, Университет Цинхуа) · Китай

Синтез речи с клонированием голоса и естественной интонацией. VoxCPM2 поддерживает 30 языков, включая русский.

  • Клонирование голоса
  • Озвучка роликов и аудиокниг
  • Голос для ассистента
Размеры
0.5B – 2.3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речи2025–2026

Kyutai STT, TTS и Pocket TTS

Kyutai · Франция

Потоковые модели распознавания и синтеза речи от авторов Moshi: начинают говорить и расшифровывать, не дожидаясь конца фразы. Pocket TTS (100M) работает на процессоре. Английский, французский и ещё несколько европейских языков, русского нет.

  • Потоковая расшифровка речи для голосовых ботов
  • Озвучка ответов с минимальной задержкой
  • Синтез речи на сервере без видеокарты (Pocket TTS)
Размеры
100M (Pocket TTS) – 2.6B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голосовые ассистенты2024–2026

Audio Flamingo

NVIDIA · США

Модели, которые слушают речь, звуки и музыку и отвечают на вопросы о них. Audio Flamingo Next разбирает записи до 30 минут. Только для исследований.

  • Подробное описание аудиозаписей
  • Вопросы и ответы по длинной записи
  • Разметка музыки и звуков
Размеры
0.5B – 8B
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Компьютерное зрение2023–2026

Segment Anything (SAM)

Meta · США

Выделяет любой объект на фото и видео по клику или рамке. Основа для удаления фона и подсчёта объектов.

  • Удаление фона с фото товара
  • Подсчёт объектов на фото
  • Разметка данных для обучения
Размеры
91M – ~0,85B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Речь в текстRUGGUF2025–2026

Voxtral

Mistral AI · Франция

Речевые модели Mistral: понимают аудио, расшифровывают и отвечают на вопросы по записи. Realtime-версия распознаёт в реальном времени и поддерживает русский; есть синтез речи.

  • Расшифровка и краткое содержание записей
  • Вопросы к аудио
  • Распознавание в реальном времени
Размеры
3B – 24B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Синтез речиRU2024–2026

Fish Speech / OpenAudio

Fish Audio · США / Китай

Синтез речи с клонированием голоса и управлением эмоциями на 80+ языках, включая русский. Качество близко к платным сервисам, но веса только для исследований.

  • Клонирование голоса
  • Эмоциональная озвучка
  • Озвучка на многих языках
Размеры
0.5B – около 4.5B
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Текст2025–2026

Reka Flash и Reka Edge

Reka AI · США

Компактные модели Reka: Flash 3 на 21B для рассуждений и Reka Edge на 7B, которая быстро разбирает изображения и видео на устройстве.

  • Разбор фото и видео (Edge)
  • Поиск объектов на изображениях
  • Задачи с рассуждением (Flash)
Размеры
7B – 21B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Голос: спикеры и звукRU2026

FireRedVAD

FireRedTeam (Xiaohongshu) · Китай

Детектор речи и звуковых событий: отличает речь, пение и музыку. В тесте на 102 языках (набор FLEURS, русский входит) обошёл Silero VAD и TEN VAD. Есть потоковый режим.

  • Нарезка записей перед распознаванием речи
  • Отделение речи от музыки и пения в эфирах и роликах
  • Определение речи в голосовых ботах
Размеры
компактная, точный размер не указан
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиRU2026

OmniVoice

k2-fsa (Next-gen Kaldi) · Китай

Синтез речи с клонированием голоса по короткому образцу на 646 языках, включая русский и языки народов России. Можно описать голос словами. Веса только для некоммерческого использования.

  • Озвучка на редких языках
  • Клонирование голоса по образцу
  • Исследования и прототипы многоязычной озвучки
Размеры
0.6B
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Видео2025–2026

Matrix-Game

Skywork AI (Kunlun) · Китай

Интерактивная «модель мира»: генерирует видео игрового мира в реальном времени и реагирует на нажатия клавиш и мышь. Версия 3.0 держит память о сцене минутами.

  • Прототипы игровых миров без движка
  • Интерактивные демо и симуляции
  • Генерация данных для обучения агентов
Размеры
1.8B – 17B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Обработка фото2025–2026

MatAnyone

S-Lab, Наньянский технологический университет · Сингапур

Вырезает человека из видео с точной альфа-маской, включая волосы и края, без зелёного фона. Нужна маска первого кадра, например из SAM.

  • Замена фона на видео без хромакея
  • Вырезание человека для монтажа и эффектов
  • Подготовка роликов для рекламы и соцсетей
Размеры
около 35M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Музыка и звук2025–2026

ThinkSound / PrismAudio

Alibaba Tongyi (FunAudioLLM) · Китай

Генерирует и редактирует звук к видео, тексту или аудио, сначала «рассуждая» о сцене через мультимодальную модель. PrismAudio — следующая версия для звука к видео.

  • Звук к видео по сцене
  • Редактирование отдельных звуков в дорожке
  • Звуковые эффекты по описанию
Размеры
размер на карточке не указан
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Аватары2026

daVinci-MagiHuman

SII-GAIR и Sand.ai · Китай

Генерирует видео с говорящим человеком сразу со звуком: один трансформер обрабатывает текст, видео и аудио. Речь на 7 языках, русского в списке нет. Есть дистиллированные быстрые версии.

  • Видео с ведущим по сценарию
  • Рекламные ролики с говорящим персонажем
  • Обучающие видео с диктором
Размеры
15B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
КартинкиGGUF2024–2026

FLUX

Black Forest Labs · Германия

Генерация картинок от авторов Stable Diffusion. Хорошо рисует текст на изображении и держит композицию.

  • Картинки для карточек товаров
  • Баннеры и обложки
  • Редактирование фото по описанию (Kontext)
Размеры
4B – 32B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
КартинкиGGUF2024–2026

Hunyuan Image

Tencent · Китай

Модели картинок Tencent. HunyuanImage 3.0 — крупнейшая открытая MoE-модель генерации на 80B, умеет рассуждать над запросом и редактировать по инструкции.

  • Сложные сцены по длинному описанию
  • Картинки с текстом на китайском и английском
  • Редактирование изображений по инструкции
Размеры
1.5B – 80B-A13B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
КартинкиGGUF2025–2026

Z-Image

Alibaba (Tongyi-MAI) · Китай

Компактная модель на 6B с фотореализмом уровня крупных моделей. Turbo-версия выдаёт картинку за несколько шагов на обычной игровой видеокарте.

  • Фотореалистичные рекламные картинки
  • Картинки с текстом на английском и китайском
  • Массовая генерация визуалов
Размеры
6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
ВидеоGGUF2025–2026

SkyReels

Skywork AI (Kunlun Tech) · Китай

Видеомодели для кинематографичных сцен с людьми. Умеют ролики неограниченной длины, продление видео и говорящих персонажей по аудио.

  • Длинные ролики с продолжением
  • Видео с одним персонажем по референсу
  • Говорящий аватар по голосу
Размеры
1.3B – 19B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Синтез речиRUGGUF2026

Qwen3-TTS

Alibaba (Qwen) · Китай

Синтез речи на 10 языках, включая русский: клонирование голоса по 3 секундам, готовые голоса и создание голоса по текстовому описанию.

  • Голос для бота и ассистента
  • Клонирование фирменного голоса
  • Подбор голоса по описанию
Размеры
0.6B – 1.7B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ВидеоGGUF2026

MOVA

OpenMOSS / MOSI · Китай

Генерирует видео сразу со звуком: речь с синхронными губами, эффекты и окружение в одном проходе. MoE-архитектура на 32B параметров, есть версии 360p и 720p.

  • Короткие ролики с речью и звуком по описанию
  • Рекламные сцены с диалогами
  • Прототипы видео для сторибордов
Размеры
32B-A18B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
3DGGUF2024–2025

TRELLIS

Microsoft · США

Одна из сильнейших открытых 3D-моделей: по картинке или тексту выдаёт сетку с текстурой или гауссову сцену. TRELLIS.2 заметно детальнее первой версии.

  • 3D-модели товаров и интерьера по фото
  • Ассеты для игр и AR/VR
  • Прототипы для 3D-печати
Размеры
до 4B (TRELLIS.2)
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Компьютерное зрениеGGUF2024–2025

Depth Anything

ByteDance и Гонконгский университет · Китай

Определяет глубину — расстояние до каждой точки — по одной обычной фотографии или видео. DA3 восстанавливает геометрию сцены с нескольких кадров.

  • Оценка расстояний и объёмов по камере
  • Эффекты глубины для фото и видео
  • Навигация роботов и дронов
Размеры
25M – 1.4B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Речь в текстRU2025

Omnilingual ASR

Meta · США

Распознавание речи на 1600+ языках, включая русский и редкие языки, которые раньше не поддерживала ни одна система. Новый язык можно добавить по нескольким примерам.

  • Расшифровка на редких и местных языках
  • Оцифровка устных архивов
  • Субтитры на многих языках
Размеры
300M – 7B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текст2024–2025

SenseVoice / Paraformer / Fun-ASR

Alibaba (Tongyi, FunAudioLLM) · Китай

Набор моделей Alibaba для быстрого распознавания речи, в первую очередь китайской и азиатских языков. SenseVoice дополнительно определяет эмоции и звуковые события.

  • Расшифровка звонков
  • Определение эмоций в голосе
  • Распознавание смеха, музыки и других звуков
Размеры
около 230M – 800M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Синтез речиRU2024–2025

CosyVoice / Fun-CosyVoice

Alibaba (Tongyi, FunAudioLLM) · Китай

Синтез речи с клонированием голоса по короткому образцу и потоковой выдачей для живого диалога. Третья версия поддерживает 9 языков, включая русский.

  • Голос для бота и ассистента
  • Клонирование фирменного голоса
  • Озвучка роликов
Размеры
300M – 0.5B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2025

HyperCLOVA X SEED

Naver · Южная Корея

Открытые младшие модели корейского Naver: от 0.5B до 32B, включая рассуждающие Think и мультимодальные версии с пониманием картинок.

  • Лёгкий корейско-английский ассистент
  • Разбор картинок и документов
  • Классификация текстов
Размеры
0.5B – 32B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Голос: спикеры и звук2025

SAM Audio

Meta · США

Модель вырезает из записи нужный звук по текстовому описанию, по отметке на видео или по отрезку: голос, инструмент, шум. Доступ к весам выдают по заявке.

  • Выделить голос одного человека из шумной записи
  • Убрать посторонний звук из видео
  • Разобрать запись на отдельные источники звука
Размеры
small, base, large (от 5 до 15 ГБ весов)
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
3D2025

MapAnything

Meta и Университет Карнеги — Меллон · США

Одна модель собирает метрическую 3D-реконструкцию из фото, а если есть данные о камерах, глубине или позах — учитывает и их. Есть версия весов под Apache 2.0.

  • 3D-реконструкция объекта или помещения по фото
  • Экспорт сцены в формат COLMAP для дальнейшей обработки
  • Оценка глубины и положения камер
Размеры
около 1.2B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
3D2025

Pi3 (π³)

Shanghai AI Lab · Китай

Восстанавливает 3D-сцену и положения камер по набору фото или видео, не опираясь на «опорный» кадр. Pi3X даёт более гладкие облака точек и примерный масштаб в метрах.

  • 3D-реконструкция сцены по видео
  • Оценка положения камеры по кадрам
  • Облака точек для исследований и прототипов
Размеры
0.96B – 1.4B
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
3D2025

HY-Motion

Tencent Hunyuan · Китай

Генерирует 3D-анимацию движения человека по текстовому описанию: скелетная анимация сразу подходит для 3D-редакторов и игровых движков. Понимает английский и китайский.

  • Анимация персонажа по текстовому описанию
  • Черновая анимация для игр и роликов
  • Библиотека движений для аватаров
Размеры
0.46B – 1B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Компьютерное зрение2025

Perception Encoder (PE)

Meta · США

Семейство энкодеров Meta для картинок и видео, а с версией PE-AV — и для звука. PE-Core ищет по тексту точнее SigLIP 2 (по данным Meta), есть малые версии.

  • Поиск фото и видео по описанию
  • Разметка и теги каталога
  • Поиск по звуку и видео (PE-AV)
Размеры
размер на карточке не указан
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Детекция подделок2024–2025

VideoSeal

Meta · США

Водяной знак для видео и картинок, устойчивый к перекодированию и обрезке. Детектор ошибается в обе стороны: отсутствие метки не доказывает подделку, а её находка — повод для проверки человеком.

  • Пометка видео, созданного или обработанного ИИ
  • Поиск своей метки в перезалитых роликах
  • Защита рекламных материалов от переприсвоения
Размеры
метка от 96 до 1024 бит
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ВидеоGGUF2024–2025

HunyuanVideo

Tencent · Китай

Видеомодель Tencent, одна из первых открытых на уровне закрытых сервисов. Версия 1.5 стала легче (8.3B) и идёт на потребительских картах.

  • Видео по текстовому сценарию
  • Оживление изображений
  • База для дообучения своих видеомоделей
Размеры
8.3B – 13B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
3DGGUF2025

SAM 3D

Meta · США

Восстанавливает 3D-форму предмета или тела человека по одной обычной фотографии, даже если объект частично закрыт. Две модели: Objects и Body.

  • 3D-модель предмета с фото из каталога
  • Оценка позы и формы тела по фото
  • Примерка и AR-сценарии
Размеры
н/д
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Синтез речи2025

Dia

Nari Labs · Южная Корея

Модель, которая озвучивает целые диалоги на два голоса со смехом, вздохами и паузами. Только английский.

  • Озвучка диалогов и подкастов
  • Рекламные ролики с живой речью
  • Сценки для обучения
Размеры
1B – 2B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голос: спикеры и звукRU2020–2025

Silero VAD

Silero · Россия

Самый популярный открытый детектор речи: отличает голос от тишины и шума. Обрабатывает фрагмент звука меньше чем за миллисекунду на одном ядре процессора, обучен на записях более чем 6000 языков.

  • Нарезка звонков и записей перед распознаванием речи
  • Определение, когда клиент говорит, в голосовом боте
  • Отсев тишины и шума, экономия на расшифровке
Размеры
около 2 МБ
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Видео2025

Ovi

Character.AI · США

Генерирует видео вместе со звуком и речью по тексту или картинке: две ветви (видео на базе Wan 2.2 и аудио 5B) работают синхронно. Нужно 24–32 ГБ видеопамяти.

  • Короткие ролики с говорящими персонажами
  • Оживление картинки с озвучкой
  • Прототипы рекламных сцен
Размеры
11B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Компьютерное зрение2023–2025

MetaCLIP / MetaCLIP 2

Meta · США

Открытый повтор CLIP от Meta с прозрачным рецептом сбора данных. MetaCLIP 2 обучен на многоязычных данных со всего мира. Только некоммерческая лицензия.

  • Поиск картинок по тексту
  • Классификация изображений без обучения
  • Исследования и прототипы поиска
Размеры
0.15B – 3.6B
Железо
от: Ноутбук
Только некоммерческоеПодробнее
ВидеоGGUF2025

LongCat-Video

Meituan · Китай

Видеомодель на 13.6B: из текста, из картинки и продолжение видео. Держит качество на роликах в несколько минут.

  • Длинные ролики
  • Видео из фото
  • Продолжение готового видео
Размеры
13.6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Музыка и звук2025

DiffRhythm

ASLP-lab (Северо-Западный политехнический университет) · Китай

Быстрая генерация полной песни с вокалом по тексту и образцу стиля, до нескольких минут звучания.

  • Песни и джинглы по тексту
  • Музыка для роликов
  • Демо-версии композиций
Размеры
около 1.1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Детекция подделок2025

AntiDeepfake (NII)

National Institute of Informatics, Yamagishi Lab · Япония

Семь речевых энкодеров (wav2vec 2.0, XLS-R, MMS, HuBERT), дообученных различать живую и синтезированную речь. Разработчики сами отмечают: качество сильно зависит от набора данных, вывод проверяет человек.

  • Проверка аудиозаписей на синтез
  • Дообучение под свой язык и канал записи
  • Сравнение нескольких энкодеров на своих данных
Размеры
0,3B – 2B
Железо
от: Ноутбук
Только некоммерческоеПодробнее
3D2024–2025

Hunyuan3D

Tencent · Китай

Открытая 3D-линейка Tencent: форма и текстура по картинке, качество на уровне платных сервисов. Omni добавляет управление позой и формой, Part делит модель на детали.

  • 3D-модели товаров с текстурой
  • Персонажи и предметы для игр
  • Разделение модели на детали для печати
Размеры
набор моделей: форма и текстуры
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Речь в текстRU2023–2025

Vosk (русские модели)

Alpha Cephei · Россия

Офлайн-распознавание русской речи, которое работает даже на Raspberry Pi и телефоне, без интернета. Есть потоковые модели для живого звука и простой русский синтез речи Vosk TTS.

  • Расшифровка звонков и записей на русском без облака
  • Голосовое управление в приложениях и киосках
  • Распознавание речи в потоке с малой задержкой
Размеры
около 45 МБ – 1,8 ГБ
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голосовые ассистентыRUGGUF2025

Qwen Omni

Alibaba (Qwen) · Китай

Модели, которые понимают текст, картинки, аудио и видео и отвечают голосом в реальном времени. Qwen3-Omni говорит на 10 языках, включая русский.

  • Голосовой ассистент для клиентов
  • Разбор звонков и видео
  • Ответы голосом по документам и картинкам
Размеры
3B – 30B-A3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голос: спикеры и звук2022–2025

pyannote (диаризация)

pyannoteAI (Эрве Бредин) · Франция

Самый распространённый открытый инструмент, который размечает запись по спикерам: кто и когда говорил. Обычно ставится в связку с распознаванием речи. Веса выдаются после короткой анкеты на HF.

  • Разметка звонков: где оператор, где клиент
  • Протоколы совещаний с подписью спикеров
  • Подготовка записей к расшифровке и анализу
Размеры
несколько миллионов параметров
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Музыка и звук2025

HunyuanVideo-Foley

Tencent Hunyuan · Китай

Генерирует звук студийного качества (48 кГц) к видео по картинке и текстовой подсказке: шаги, удары, окружение, синхронно с действием в кадре.

  • Фоли и звуковые эффекты к видео
  • Озвучка ИИ-роликов для рекламы
  • Саунд-дизайн для коротких видео
Размеры
не указан в карточке (веса около 10 ГБ; XL-версия с выгрузкой в память)
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Детекция подделок2023–2025

RADAR

IBM Research и The Chinese University of Hong Kong · США

Детектор ИИ-текста, обученный вместе с перефразировщиком: его специально учили не сдаваться, когда текст переписали своими словами. Ошибается в обе стороны, вывод проверяет человек.

  • Проверка текстов, которые могли переписать после генерации
  • Предварительный отсев в редакции или приёмной комиссии
  • Сравнение с более простыми детекторами
Размеры
около 355M (RoBERTa-large)
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Аватары2025

MultiTalk / InfiniteTalk

Meituan · Китай

Дубляж и говорящие персонажи на базе Wan: MultiTalk ведёт диалог нескольких людей, InfiniteTalk переозвучивает видео любой длины с мимикой и телом.

  • Дубляж видео с подгонкой мимики
  • Диалог двух персонажей по аудио
  • Длинные ролики с ведущим
Размеры
14B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Голос: спикеры и звук2024–2025

ClearerVoice (MossFormer)

Alibaba (Tongyi Lab) · Китай

Набор моделей Alibaba для чистки речи: шумоподавление, разделение наложенных голосов, повышение качества звука до 48 кГц и выделение голоса по видео с лицом говорящего.

  • Шумоподавление записей разговоров
  • Разделение двух голосов, говорящих одновременно
  • Улучшение старых и телефонных записей
Размеры
менее 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиRU2025

ESpeech-TTS

ESpeech (независимая группа русскоязычных разработчиков) · Россия

Русский синтез речи с клонированием голоса на архитектуре F5-TTS, обучен на собранных авторами наборах русской речи. Ударения расставляются автоматически. Несколько вариантов, в том числе «подкастер».

  • Озвучка роликов и аудиокниг на русском
  • Клонирование голоса диктора по образцу
  • Голос для бота или ассистента на русском
Размеры
около 340M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Видео2025

Hunyuan-GameCraft

Tencent Hunyuan · Китай

Делает из одной картинки управляемое видео игровой сцены: камера движется по командам клавиатуры. Минимум 24 ГБ видеопамяти, рекомендовано 80 ГБ.

  • Интерактивные видео-прототипы игровых локаций
  • Ролики с проходом камеры по сцене
  • Демо уровней для питчей
Размеры
на базе HunyuanVideo
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Детекция подделок2023–2025

DeepfakeBench

The Chinese University of Hong Kong, Shenzhen (SCLBD) · Китай

Набор из десятков открытых детекторов подмены лица на видео и фото под общим кодом и с готовыми весами. Детектор ошибается в обе стороны: его вывод — повод для проверки человеком, а не доказательство подделки.

  • Первичная проверка присланного видео или селфи
  • Сравнение нескольких детекторов на своих данных
  • Дообучение детектора под свой поток заявок
Размеры
детекторы уровня Xception и EfficientNet, десятки миллионов параметров
Железо
от: Ноутбук
Только некоммерческоеПодробнее
ПереводRUGGUF2025

Seed-X

ByteDance Seed · Китай

Компактный переводчик ByteDance на 28 языков, по качеству близкий к крупным закрытым системам. Русский есть. Есть готовые сжатые версии.

  • Перевод деловой переписки и документов
  • Перевод карточек товаров
  • Перевод технических и юридических текстов
Размеры
7B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Обработка фотоGGUF2024–2025

BiRefNet

Нанькайский университет · Китай

Открытая модель точного выделения объекта и удаления фона под лицензией MIT. На ней построен RMBG-2.0. Есть версии для 2K и для волос и полупрозрачных краёв.

  • Удаление фона с фото товаров потоком
  • Точные маски для дизайна и печати
  • Вырезка людей с волосами для рекламы
Размеры
около 220M (есть облегчённые lite)
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Детекция подделок2024–2025

Watermark Anything (WAM)

Meta · США

Водяной знак для картинок, который можно поставить на отдельные участки: модель показывает, какая часть изображения помечена. Ошибается в обе стороны — итог проверяет человек.

  • Пометка сгенерированных и отредактированных изображений
  • Поиск помеченного фрагмента в коллаже
  • Отслеживание, какие части картинки сделал ИИ
Размеры
кодировщик и декодировщик метки для изображений
Железо
от: Ноутбук
Можно в коммерциюПодробнее
КартинкиGGUF2024–2025

OmniGen

BAAI (Пекинская академия ИИ) · Китай

Универсальная модель: генерирует, редактирует, переносит объект или человека с фото в новую сцену без отдельных плагинов.

  • Перенос товара или человека в новую сцену
  • Редактирование фото по инструкции
  • Генерация по нескольким референсам
Размеры
около 4B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Обработка фото2025

SeedVR / SeedVR2

ByteDance Seed · Китай

Восстановление и увеличение видео и фото от ByteDance. SeedVR2 делает это за один шаг, поэтому заметно быстрее похожих моделей. Коммерческая лицензия.

  • Увеличение фото и видео до 2K–4K
  • Восстановление старых роликов и снимков
  • Улучшение пользовательских фото перед публикацией
Размеры
3B – 7B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Голос: спикеры и звук2024–2025

GPT-SoVITS

RVC-Boss и сообщество · Китай

Синтез речи с клонированием голоса: хватает 5 секунд образца, а после дообучения на минуте записи голос звучит заметно точнее. Использовать только с согласия владельца голоса.

  • Озвучка текстов голосом конкретного диктора
  • Голос для бота или ассистента
  • Дубляж обучающих роликов
Размеры
менее 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Аватары2025

LatentSync

ByteDance · Китай

Подгоняет движения губ на готовом видео под новую озвучку. Версия 1.6 работает в 512 пикселей и даёт более чёткое лицо.

  • Переозвучка роликов на другой язык с попаданием в губы
  • Правка реплик в готовом видео без пересъёмки
  • Говорящие аватары для обучающих курсов
Размеры
нужно 8–18 ГБ видеопамяти
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Детекция подделок2024–2025

AIDE

Xiaohongshu, USTC и Shanghai Jiao Tong University · Китай

Детектор ИИ-картинок из нескольких экспертов: одни смотрят на визуальные артефакты, другие на шум. Вместе с ним выпущен сложный набор Chameleon. Ошибается в обе стороны — итог проверяет человек.

  • Проверка реалистичных ИИ-изображений без явных артефактов
  • Сравнение детекторов на сложных примерах
  • Дообучение под свой тип контента
Размеры
несколько экспертов на базе ConvNeXt и CLIP
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
АватарыGGUF2025

HunyuanVideo-Avatar

Tencent · Китай

Говорящие персонажи на базе HunyuanVideo: передаёт эмоции голоса, работает с несколькими персонажами и разными стилями.

  • Видео с ведущим по фото и аудио
  • Сцены с несколькими говорящими
  • Мультяшные персонажи
Размеры
около 13B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Голос: спикеры и звук2024–2025

Seed-VC

Songting Liu (Plachtaa) · Китай

Конверсия голоса без обучения: переносит тембр по образцу в 1–30 секунд, умеет петь и работать в реальном времени, V2 меняет и акцент. Использовать только с согласия владельца голоса.

  • Переозвучка ролика другим голосом
  • Анонимизация голоса в записях
  • Голос в реальном времени для стримов
Размеры
около 70M – 200M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Модерация и безопасность2023–2025

NSFW-классификаторы (Falconsai, Freepik)

Falconsai и Freepik · США и Испания

Небольшие модели, которые отличают откровенные картинки от обычных. Freepik различает четыре уровня откровенности. Работают на процессоре.

  • Фильтр пользовательских фото и аватаров
  • Проверка картинок от генераторов перед публикацией
  • Разметка медиатеки
Размеры
86M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голосовые ассистенты2025

Kimi-Audio

Moonshot AI · Китай

Универсальная аудиомодель: распознаёт речь, отвечает на вопросы о звуке, определяет эмоции и ведёт голосовой диалог. Обучена на 13 млн часов аудио, языки — английский и китайский.

  • Распознавание речи
  • Определение эмоций и звуковых событий
  • Голосовой диалог речь-в-речь
Размеры
7B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Речь в текстRUGGUF2022–2025

Whisper

OpenAI · США

Распознавание речи на 99 языках, включая русский. Стандарт де-факто для расшифровки звонков и встреч. Ускоренные Distil-Whisper от Hugging Face — только для английского.

  • Расшифровка звонков и созвонов
  • Субтитры к видео
  • Голосовые сообщения в текст
Размеры
39M – 1,5B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Видео2024–2025

Open-Sora

HPC-AI Tech · Сингапур

Полностью открытый проект видеогенерации: веса, код и рецепт обучения. Версия 2.0 на 11B делает видео из текста и из картинки.

  • Видео по текстовому описанию
  • Оживление картинок
  • Обучение своей видеомодели
Размеры
до 11B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Видео2025

Step-Video

StepFun · Китай

Крупная видеомодель на 30B с роликами до 204 кадров. Требует серверного железа, зато открыта под MIT.

  • Видео по описанию
  • Оживление изображений
Размеры
30B
Железо
от: Кластер
Можно в коммерциюПодробнее
Аватары2024–2025

MuseTalk

Tencent Music (Lyra Lab) · Китай

Синхронизация губ в реальном времени: подгоняет рот на видео под новое аудио. Подходит для перевода видео и живых аватаров.

  • Дубляж видео на другой язык
  • Живой аватар в видеочате
  • Правка речи в готовом ролике
Размеры
меньше 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиGGUF2024–2025

F5-TTS

Шанхайский университет Цзяотун и партнёры · Китай

Модель клонирования голоса по нескольким секундам образца, английский и китайский. Сообщество выпустило много дообученных версий под другие языки, в том числе русский.

  • Клонирование голоса
  • Озвучка аудиокниг и роликов
  • Исследования и прототипы
Размеры
около 340M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Синтез речиGGUF2025

Orpheus TTS

Canopy Labs · США

Синтез речи на основе языковой модели с живыми интонациями и эмоциональными вставками. Быстро отвечает, подходит для голосовых ассистентов. В основном английский.

  • Голос для ассистента в реальном времени
  • Эмоциональная озвучка
  • Клонирование голоса
Размеры
3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиGGUF2025

Sesame CSM

Sesame · США

Модель разговорной речи, которая учитывает контекст беседы и звучит как живой собеседник. Только английский.

  • Голос для разговорного ассистента
  • Озвучка диалогов
  • Прототипы голосовых продуктов
Размеры
1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Лица2025

InfiniteYou

ByteDance · Китай

Генерация картинок с сохранением лица на базе FLUX: лучше следует описанию и реже копирует лицо как наклейку. Лицензия только исследовательская.

  • Портреты по одному фото с точным описанием сцены
  • Тесты персонажей для рекламы
  • Сравнение методов сохранения лица
Размеры
адаптер к FLUX.1-dev
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Детекция подделок2025

Desklib AI Text Detector

Desklib · Индия

Свежий открытый детектор ИИ-текста на DeBERTa-v3-large, обучен на наборе RAID; есть отдельная версия под учебные работы. Ошибается в обе стороны — итог всегда проверяет человек.

  • Проверка присланных статей и отчётов
  • Отсев шаблонных отзывов и откликов
  • Предварительная проверка учебных работ
Размеры
0,4B (DeBERTa-v3-large)
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Компьютерное зрение2023–2025

SigLIP (наследник CLIP)

Google · США

Модели, которые переводят картинки и текст в общее пространство: можно искать фото по словам и классифицировать изображения без обучения. CLIP от OpenAI (2021) — предшественник.

  • Поиск картинок по текстовому запросу
  • Автоматическая разметка и теги каталога
  • Фильтрация недопустимого контента
Размеры
около 0.2B – 2B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиGGUF2024–2025

Kokoro

hexgrad (независимый разработчик) · не указана

Крошечная модель синтеза речи (82M), которая звучит на уровне крупных. Работает на обычном процессоре; английский и ещё несколько языков, русского нет.

  • Озвучка статей и уведомлений
  • Голос для приложений без видеокарты
  • Массовая озвучка текстов
Размеры
82M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
3D2024–2025

Stable Fast 3D / SPAR3D

Stability AI · Великобритания

Модели Stability AI, которые за секунду превращают одну фотографию в 3D-модель с текстурой. SPAR3D позволяет поправить форму через облако точек.

  • 3D-карточки товаров по фото
  • Ассеты для игр и AR
  • Быстрые макеты для дизайна
Размеры
1B – 2B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Обработка фото2024–2025

BEN2

Prama LLC · США

Модель удаления фона с упором на сложные края: волосы, мех, тонкие детали. Открытая версия под MIT, умеет обрабатывать видео.

  • Вырезка товара и людей с фото
  • Удаление фона на видео
  • Подготовка фото для каталога
Размеры
около 95M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текстGGUF2024–2025

Janus

DeepSeek · Китай

Одна модель и понимает картинки, и рисует их по описанию. Janus-Pro-7B была заметна в начале 2025 года, но по качеству картинок уступает специализированным моделям.

  • Ответы на вопросы по картинкам
  • Черновые иллюстрации по описанию
  • Эксперименты с единой моделью зрения и генерации
Размеры
1B – 7B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Компьютерное зрение2022–2025

ViTPose

Сиднейский университет и JD Explore Academy · Австралия / Китай

Простая и точная модель определения позы человека по ключевым точкам. Версия ViTPose++ умеет позы людей, животных и всего тела; встроена в библиотеку Transformers.

  • Ключевые точки тела на фото и видео
  • Анализ движений в спорте и реабилитации
  • Контроль рабочих поз и техники безопасности
Размеры
33M – около 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текст2023–2025

VideoLLaMA

Alibaba DAMO Academy · Китай

Модели, которые смотрят видео и отвечают на вопросы о нём: что происходит, в какой момент, кто что делает. VideoLLaMA 3 на 2B и 7B — одни из сильнейших в своём размере.

  • Описание и краткий пересказ видео
  • Поиск момента в записи по вопросу
  • Разметка видеоархива
Размеры
2B – 72B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Примерка одежды2024

Leffa

Meta AI (вместе с King's College London) · США

Модель Meta для примерки и смены позы человека на фото. Бережно переносит мелкие детали ткани и надписи. Лицензия MIT, но обучающие данные некоммерческие.

  • Примерка одежды на фото модели
  • Смена позы модели на уже снятом кадре
  • Добор ракурсов для карточки товара
Размеры
на базе Stable Diffusion
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Музыка и звук2024

MMAudio

Иллинойсский университет и Sony AI · США / Япония

Озвучивает немое видео: генерирует шумы и звуковые эффекты, синхронные с происходящим в кадре, по видео и текстовой подсказке. Одна из первых сильных открытых моделей фоли.

  • Звуковые эффекты к немому видео
  • Озвучка роликов от ИИ-генераторов
  • Черновой саунд-дизайн для монтажа
Размеры
размер на карточке не указан
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Музыка и звук2024

MuQ / MuQ-MuLan

Tencent AI Lab · Китай

Музыкальный энкодер MuQ и модель MuQ-MuLan, которая сопоставляет музыку и текст: можно искать треки по описанию на английском или китайском.

  • Поиск музыки по текстовому описанию
  • Разметка треков по жанру и настроению
  • Подбор похожей музыки
Размеры
300M – 700M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Детекция подделок2024

AudioSeal

Meta · США

Незаметная метка в синтезированной речи и быстрый детектор, который находит её даже в куске длинной записи. Детектор ошибается в обе стороны: срабатывание — повод для проверки человеком, а не доказательство.

  • Пометка речи, синтезированной вашим сервисом
  • Поиск своей метки в чужих публикациях
  • Проверка, не подмешан ли синтез в запись разговора
Размеры
генератор и детектор водяного знака, 16 бит сообщения
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Поиск по сканам документов2024

GME (General Multimodal Embedding)

Alibaba (Tongyi Lab) · Китай

Один вектор и для текста, и для картинки, и для их пары: одной моделью можно искать товар по фото, страницу документа по вопросу и картинку по описанию. Языки в карточке: английский и китайский.

  • Поиск товара по фотографии
  • Поиск по каталогу картинок и карточек
  • Поиск по страницам документов как по изображениям
Размеры
2B и 7B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Синтез речиGGUF2024

Parler-TTS

Hugging Face · США

Синтез речи, где голос задаётся текстовым описанием («спокойный женский голос, чистая запись»). Английский и 8 европейских языков, русского нет.

  • Подбор голоса по описанию
  • Озвучка роликов
  • Прототипы голосовых сервисов
Размеры
880M – 2.2B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Музыка и звук2023–2024

MusicGen (AudioCraft)

Meta · США

Генерация инструментальной музыки по текстовому описанию или по мелодии-образцу. Одна из первых открытых моделей такого рода.

  • Черновые музыкальные наброски
  • Музыка для прототипов роликов
  • Исследования
Размеры
300M – 3.3B
Железо
от: Ноутбук
Только некоммерческоеПодробнее
КартинкиGGUF2022–2024

Stable Diffusion

Stability AI · Великобритания

Модель, с которой началась открытая генерация картинок. Огромная экосистема дообучений, стилей и плагинов, работает даже на домашнем ПК. Популярные ускорители SDXL-Lightning и Hyper-SD сделала ByteDance.

  • Иллюстрации и баннеры для рекламы
  • Фоны и сцены для карточек товаров
  • Дообучение под фирменный стиль
Размеры
0.9B – 8B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
ВидеоGGUF2024

Mochi

Genmo · США

Открытая видеомодель на 10B с реалистичным движением. На момент выхода была одной из сильнейших открытых, сейчас обновлений нет.

  • Видео по описанию
  • Короткие рекламные сцены
Размеры
10B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Лица2024

PuLID

ByteDance · Китай

Сохраняет лицо человека при генерации картинок по одному фото и меньше портит стиль и фон. Есть версии для SDXL и FLUX, вторая идёт на карте 16 ГБ.

  • Портреты и аватары по одному фото
  • Персонажи для рекламы с узнаваемым лицом
  • Прототипы фотосессий
Размеры
адаптеры к SDXL и FLUX.1-dev
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Видео2022–2024

RIFE (Practical-RIFE)

hzwer (Хуан Чжэвэй) и соавторы · Китай

Дорисовывает промежуточные кадры: превращает 24–30 кадров в секунду в 60 и больше и делает плавное замедление. Версии 4.24+ хорошо сглаживают видео от генеративных моделей.

  • Повышение частоты кадров видео
  • Плавное замедленное видео
  • Сглаживание роликов от ИИ-генераторов
Размеры
лёгкая модель (размер в карточке не указан)
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Поиск по сканам документов2024

VLM2Vec

TIGER-Lab · Канада

Превращает модель «картинка плюс текст» в модель эмбеддингов: один вектор для страницы, схемы или фото с подписью. В карточке заявлен английский язык.

  • Поиск по смешанному архиву текстов и картинок
  • Поиск по страницам документов как по изображениям
  • Подбор похожих карточек и иллюстраций
Размеры
около 4B (на базе Phi-3.5-V)
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Обработка фото2024

Flux.1-dev ControlNet Upscaler

Jasper AI · США

Дополнение к FLUX для увеличения маленьких и размытых картинок с дорисовкой деталей. Популярно, но под некоммерческой лицензией FLUX dev.

  • Увеличение мелких картинок с дорисовкой
  • Улучшение сгенерированных изображений
  • Пилоты апскейла для каталога
Размеры
дополнение к FLUX.1 dev 12B
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Картинка + текстНе развивается2023–2024

IDEFICS

Hugging Face · Франция / США

Открытые модели зрения от Hugging Face, воспроизводившие закрытую Flamingo. Idefics3 стала основой для компактной линейки SmolVLM.

  • Ответы на вопросы по картинкам
  • Разбор документов и скриншотов
  • Основа для дообучения
Размеры
8B – 80B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
КартинкиНе развивается2023–2024

ControlNet

Лвминь Чжан (Стэнфорд) и сообщество · США

Надстройка над моделями картинок: задаёт позу, контуры, глубину или планировку, чтобы результат точно повторял нужную композицию.

  • Картинка по эскизу или контуру
  • Сохранение позы и композиции
  • Визуализация интерьеров по планировке
Размеры
0.4B – 1.3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ВидеоНе развивается2023–2024

AnimateDiff

Shanghai AI Lab и CUHK · Китай

Модуль, который оживляет модели картинок Stable Diffusion и превращает их в короткую анимацию. Одна из первых открытых видеотехнологий.

  • Короткие анимации в фирменном стиле
  • Живые обложки и баннеры
  • Анимированные стикеры
Размеры
модуль движения поверх SD 1.5 / SDXL
Железо
от: Ноутбук
Можно в коммерциюПодробнее
АватарыНе развивается2024

LivePortrait

Kuaishou (Kling) · Китай

Оживляет портрет по видео-образцу: мимика и повороты головы переносятся с актёра на фото. Быстро работает даже на слабой видеокарте.

  • Оживление портретов
  • Перенос мимики актёра на персонажа
  • Анимация маскотов
Размеры
меньше 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текстНе развивается2024

Florence-2

Microsoft · США

Очень маленькая модель зрения: подписи, поиск объектов, сегментация и чтение текста по одной команде. Работает даже на процессоре.

  • Чтение текста на фото
  • Поиск и выделение объектов
  • Автоматические подписи к фото
Размеры
0.23B – 0.77B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Обработка фотоНе развивается2023–2024

PowerPaint

Shanghai AI Laboratory (OpenMMLab) и Университет Цинхуа · Китай

Универсальная дорисовка фото: убрать объект, вставить новый по описанию, заменить форму или расширить кадр за края.

  • Удаление и замена объектов на фото
  • Расширение кадра под нужный формат
  • Вставка товара или детали по текстовому описанию
Размеры
на базе SD 1.5
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Обработка фотоНе развивается2024

IC-Light

Лвмин Чжан (автор ControlNet) · США

Меняет освещение на фото: ставит объект или человека в новый свет по описанию или под заданный фон, чтобы вырезка смотрелась естественно.

  • Подгонка света товара под новый фон
  • Студийный свет для портретов без пересъёмки
  • Единый стиль освещения в каталоге
Размеры
на базе SD 1.5
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Детекция подделокНе развивается2024

MAGE

UC Santa Barbara и соавторы · США

Детектор ИИ-текста на Longformer: держит длинный документ целиком и обучен на текстах от множества разных языковых моделей. Ошибается в обе стороны, его вывод — повод для проверки человеком.

  • Проверка длинных статей и отчётов целиком
  • Отсев машинного текста в потоке публикаций
  • Сравнение детекторов на своих данных
Размеры
около 150M (Longformer-base)
Железо
от: Ноутбук
Можно в коммерциюПодробнее
КартинкиНе развивается2023–2024

PixArt

Huawei Noah's Ark Lab и партнёры · Китай

Компактная модель картинок на 0.6B с качеством уровня крупных. Умеет 4K в версии Sigma, подходит для скромного железа.

  • Иллюстрации для статей и соцсетей
  • Фоны для карточек товаров
  • Быстрые черновики визуалов
Размеры
0.6B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
3DНе развивается2024

InstantMesh

Tencent ARC · Китай

Делает 3D-сетку по одной картинке примерно за 10 секунд: сначала рисует объект с нескольких ракурсов, потом собирает из них модель.

  • 3D-модель объекта по фото
  • Заготовки для игр и визуализаций
  • Прототипы для 3D-печати
Размеры
н/д
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Голос: спикеры и звукНе развивается2024

OpenVoice

MyShell и MIT · США

Мгновенное клонирование голоса по короткому образцу с управлением эмоцией и акцентом, V2 говорит на нескольких языках. Использовать только с согласия владельца голоса.

  • Озвучка роликов голосом диктора компании
  • Голосовой бот с узнаваемым голосом бренда
  • Перенос тембра на готовый синтез речи
Размеры
менее 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ЛицаНе развивается2023–2024

IP-Adapter-FaceID

Tencent AI Lab (h94) · Китай

Один из первых адаптеров, которые переносят лицо с фото в сгенерированную картинку. Версии для SD 1.5 идут на слабых картах, но веса некоммерческие.

  • Портреты по фото в разных стилях
  • Серии картинок с одним персонажем
  • Эксперименты с аватарами
Размеры
адаптеры к SD 1.5 и SDXL
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Синтез речиНе развивается2024

MeloTTS

MyShell и MIT · США

Лёгкий многоязычный синтез речи, который успевает в реальном времени на обычном процессоре. Английский с акцентами, испанский, французский, китайский, японский и корейский; русского нет.

  • Озвучка ответов ботов на иностранных языках
  • Озвучка обучающих материалов
  • Чтение текстов вслух на сервере без видеокарты
Размеры
небольшая, работает в реальном времени на процессоре
Железо
от: Ноутбук
Можно в коммерциюПодробнее
КартинкиНе развивается2023–2024

Playground

Playground AI · США

Модель на архитектуре SDXL с упором на эстетику: яркие цвета, контраст, портреты. Совместима с инструментами экосистемы SDXL.

  • Эстетичные рекламные визуалы
  • Портреты и лайфстайл-картинки
  • Обложки для постов
Размеры
около 2.6B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Обработка фотоНе развивается2024

SUPIR

XPixel Group (Шэньчжэньский институт передовых технологий АН Китая, Shanghai AI Lab и др.) · Китай

Мощное восстановление сильно испорченных фото на базе SDXL: дорисовывает детали, а не просто увеличивает. Требовательна к железу, лицензия некоммерческая.

  • Восстановление старых и размытых фото
  • Увеличение снимков с дорисовкой деталей
  • Пилоты реставрации архивов
Размеры
на базе SDXL, плюс LLaVA 13B для описаний
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
ЛицаНе развивается2024

InstantID

InstantX (Xiaohongshu) · Китай

Генерирует картинки с лицом конкретного человека по одному фото, без дообучения. Популярен в ComfyUI, но веса только для исследований.

  • Портреты в разных стилях по одному фото
  • Эскизы аватаров и персонажей
  • Прототипы фотосессий
Размеры
адаптер к SDXL
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Обработка фотоНе развивается2023

DDColor

Alibaba DAMO Academy · Китай

Окрашивание чёрно-белых фото в естественные цвета. Лёгкая модель с коммерческой лицензией, есть компактная версия tiny.

  • Окрашивание архивных фото
  • Цветные версии исторических снимков для публикаций
  • Сервис оживления семейных фото
Размеры
DDColor-T (tiny) и DDColor-L
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голос: спикеры и звукНе развивается2023

Resemble Enhance

Resemble AI · США

Модель улучшения речи: убирает шум и дорисовывает потерянные частоты, так что глухая запись звучит как студийная. Хороша для подготовки голоса к озвучке.

  • Реставрация старых и телефонных записей
  • Очистка голоса перед озвучкой и клонированием
  • Улучшение звука в роликах и подкастах
Размеры
менее 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Детекция подделокНе развивается2023

HC3 ChatGPT Detector

Hello-SimpleAI · Китай

Один из первых открытых классификаторов ИИ-текста, обучен на корпусе HC3 из пар ответов человека и ЧатГПТ. Ошибается в обе стороны: его вывод — повод поговорить с автором, а не доказательство.

  • Предварительная проверка учебных работ
  • Отсев шаблонных откликов и отзывов
  • Разметка подозрительных текстов для ручной проверки
Размеры
около 125M (RoBERTa-base)
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Синтез речиНе развивается2023

StyleTTS 2

Колумбийский университет · США

Лёгкая модель синтеза английской речи с естественной интонацией. На её основе построены многие другие модели, например Kokoro.

  • Озвучка текстов на английском
  • Основа для дообучения своего голоса
  • Прототипы голосовых сервисов
Размеры
около 150M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
ПереводRUGGUFНе развивается2023

MADLAD-400

Google · США

Переводчик Google более чем на 400 языков под свободной лицензией. Русский есть. Хорошая замена NLLB, когда нужна коммерция.

  • Перевод документов и писем
  • Перевод каталогов и описаний товаров
  • Перевод на языки стран СНГ и Азии
Размеры
3B – 10B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речиRUНе развивается2023

Coqui XTTS

Coqui · Германия

Популярная модель клонирования голоса по короткому образцу на 17 языках, включая русский. Компания Coqui закрылась, развитие остановлено.

  • Клонирование голоса по образцу
  • Озвучка на нескольких языках
  • Исследования и прототипы
Размеры
около 470M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Музыка и звукНе развивается2023

CLAP (LAION)

LAION · Германия

Аналог CLIP для звука: переводит аудио и текст в общее пространство. Можно искать звуки и музыку по описанию и классифицировать их без обучения. Текст — английский.

  • Поиск звуков и музыки по описанию
  • Автоматические теги для аудиотеки
  • Распознавание типа звука (сирена, стекло, голос)
Размеры
размер на карточке не указан
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Обработка фотоНе развивается2022–2023

InSPyReNet / transparent-background

Ким Тэхун (POSTECH) · Южная Корея

Модель выделения главного объекта и готовая программа transparent-background на её основе: убирает фон с фото, видео и веб-камеры одной командой.

  • Пакетное удаление фона с фото
  • Замена фона на цвет или размытие
  • Удаление фона на видео
Размеры
небольшая (на базе Swin-B)
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Обработка фотоНе развивается2022–2023

HAT

XPixel Group (Шэньчжэньский институт передовых технологий АН Китая и др.) · Китай

Увеличение фото на трансформере, точнее SwinIR на тонких деталях. Есть версии для реальных снимков с шумом и лёгкая HAT-S.

  • Увеличение фото товаров и интерьеров
  • Подготовка изображений к печати
  • Повышение чёткости архивных снимков
Размеры
9M – 40M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голос: спикеры и звукНе развивается2022–2023

DeepFilterNet

Хендрик Шретер (Университет Эрлангена) · Германия

Лёгкое шумоподавление речи в реальном времени: работает даже на обычном процессоре и на слабых устройствах. Убирает гул, улицу, шум офиса, оставляя голос.

  • Очистка звонков и голосовых сообщений от шума
  • Подготовка записей перед распознаванием речи
  • Шумодав для видеосвязи
Размеры
около 2M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ТекстRUGGUFНе развивается2023

ruGPT-3.5

Сбер (ai-forever) · Россия

Базовая русскоязычная модель Сбера на 13 млрд параметров, из дообученной версии которой вырос GigaChat. Продолжает тексты на русском и английском, контекст всего 2048 токенов; сегодня интересна как основа для узкого дообучения.

  • Основа для дообучения под узкую русскую задачу
  • Генерация шаблонных русских текстов
  • Эксперименты с русскоязычными моделями без ограничений лицензии
Размеры
13B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Синтез речиRUGGUFНе развивается2023

Bark

Suno · США

Одна из первых открытых моделей, которая озвучивает текст с интонациями, смехом и паузами. Поддерживает около десятка языков, включая русский. Сейчас устарела.

  • Черновая озвучка роликов
  • Прототипы голосовых сервисов
  • Звуковые эффекты в речи
Размеры
около 300M – 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
3DНе развивается2022–2023

Point-E / Shap-E

OpenAI · США

Ранние открытые модели OpenAI, которые делают 3D-объект по тексту или картинке за секунды. Качество простое, зато быстро и легко запускается.

  • Черновые 3D-макеты по описанию
  • Быстрые прототипы объектов для игр и AR
  • Учебные и исследовательские пилоты по 3D
Размеры
40M – 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Обработка фотоНе развивается2023

StableSR

S-Lab, Наньянский технологический университет · Сингапур

Одна из первых моделей увеличения фото на базе Stable Diffusion: восстанавливает реалистичные детали. Лицензия некоммерческая.

  • Увеличение фото с дорисовкой деталей
  • Исследовательские пилоты реставрации
  • Сравнение с классическими апскейлерами
Размеры
на базе SD 2.1
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Обработка фотоНе развивается2022–2023

CodeFormer

S-Lab, Наньянский технологический университет · Сингапур

Популярная реставрация лиц на старых и размытых фото, работает и с видео. Есть режимы дорисовки и окрашивания лица. Лицензия некоммерческая.

  • Восстановление лиц на старых фото
  • Улучшение лиц на видео низкого качества
  • Пилоты реставрации семейных архивов
Размеры
небольшая, до 0.1B
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Музыка и звукНе развивается2022

AST (Audio Spectrogram Transformer)

MIT · США

Классическая модель 2021 года для распознавания звуков: определяет 527 классов событий AudioSet (сирена, лай, стекло, музыка). Лёгкая, работает без видеокарты, с 2022 года в Transformers.

  • Распознавание звуковых событий
  • Разметка аудиоархива
  • Детекция тревожных звуков
Размеры
около 87M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Обработка фотоGGUFНе развивается2021–2022

Real-ESRGAN

Tencent ARC Lab · Китай

Классика увеличения фото в 2–4 раза с очисткой от шума и артефактов сжатия. Лёгкая, работает даже на процессоре. Есть версии для рисунков и аниме.

  • Увеличение старых и мелких фото товаров
  • Очистка картинок от артефактов сжатия
  • Подготовка изображений к печати
Размеры
около 17M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Компьютерное зрениеНе развивается2021–2022

CLIP (OpenAI)

OpenAI · США

Модель 2021 года, которая первой связала картинки и текст: поиск фото по словам и классификация без обучения. Понимает только английский, сейчас чаще берут SigLIP 2 или PE.

  • Поиск картинок по текстовому запросу
  • Автоматические теги для каталога
  • Поиск похожих изображений
Размеры
около 0.15B – 0.6B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Обработка фотоНе развивается2021–2022

GFPGAN

Tencent ARC Lab · Китай

Проверенная реставрация лиц на старых и сжатых фото с коммерческой лицензией. Часто работает в паре с Real-ESRGAN, самые ходовые версии 1.3 и 1.4.

  • Восстановление лиц на старых фото
  • Улучшение аватаров и фото профиля
  • Реставрация в фотосалоне или онлайн-сервисе
Размеры
небольшая, до 0.1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Компьютерное зрениеRUНе развивается2022

ruCLIP (ai-forever)

Сбер AI и SberDevices (ai-forever) · Россия

Русская версия CLIP: сопоставляет картинки и подписи на русском. Позволяет искать фото по описанию и раскладывать изображения по категориям без обучения.

  • Поиск товаров по фото и по русскому описанию
  • Сортировка картинок по категориям без разметки
  • Проверка соответствия фото и подписи
Размеры
150M – 430M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Обработка фотоGGUFНе развивается2021

LaMa

Samsung AI Center Москва (вместе со Сколтехом) · Россия

Удаление лишних объектов, надписей и водяных знаков с фото с аккуратной дорисовкой фона. Лёгкая и быстрая, до сих пор стандарт для такой задачи.

  • Удаление ценников, людей и мусора с фото
  • Чистка фото интерьеров и недвижимости
  • Удаление надписей и дат с архивных снимков
Размеры
около 51M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Обработка фотоНе развивается2021

SwinIR

ETH Zurich · Швейцария

Модель на трансформере для увеличения, шумоподавления и очистки фото от артефактов JPEG. Лёгкая и проверенная, часто стоит внутри других систем.

  • Увеличение фото
  • Шумоподавление снимков
  • Очистка от артефактов сжатия
Размеры
около 12M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
АватарыНе развивается2020

Wav2Lip

IIIT Hyderabad · Индия

Классическая модель синхронизации губ с аудио, до сих пор популярна в любительских сборках. Губы точные, но картинка лица размытая, лицензия некоммерческая.

  • Быстрые пробы переозвучки
  • Сравнение с новыми lip-sync моделями
  • Учебные и исследовательские проекты
Размеры
малая модель, лицо 96 пикселей
Железо
от: Ноутбук
Только некоммерческоеПодробнее

Подборки

Нужна модель под вашу задачу?

Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.

  1. ПодберуМодель и размер под задачу и бюджет на железо
  2. ПоставлюНа ваш сервер или в закрытый контур, с API
  3. ДообучуНа ваших данных или подключу базу знаний
  4. ВстроюВ CRM, 1С, бота, сайт или рабочий чат
Обсудить внедрение