КартинкиGGUF2025–2026
Alibaba · Китай
Генерация и редактирование картинок, в том числе с текстом на изображении. Ранние версии можно в коммерцию, свежая 2.1 — только некоммерческая.
- Инфографика для карточек товаров
- Правка фото по текстовой команде
- Рекламные креативы
- Размеры
- 7B – 20B
- Железо
- от: 1 видеокарта
Речь в текстRUGGUF2025–2026
Microsoft · США
Речевые модели Microsoft: синтез длинных диалогов на несколько голосов, быстрый синтез для живого общения и распознавание длинных записей с разделением по говорящим, в том числе на русском.
- Расшифровка длинных встреч с разметкой говорящих
- Озвучка подкастов и диалогов
- Голос для ассистентов в реальном времени
- Размеры
- 0.5B – 9B
- Железо
- от: Ноутбук
Музыка и звукGGUF2025–2026
M-A-P и HKUST · Китай
Генерация полноценных песен с вокалом и аккомпанементом по тексту и описанию стиля: английский, китайский, японский, корейский.
- Песни и джинглы по тексту
- Демо-версии композиций
- Музыка для роликов
- Размеры
- 0.5B – 7B
- Железо
- от: 1 видеокарта
Музыка и звук2026
HeartMuLa Team · не указана
Открытая модель генерации песен с вокалом на китайском, английском, японском, корейском и испанском, плюс кодек и модель расшифровки текста песен.
- Песни и джинглы по тексту
- Музыка для роликов
- Расшифровка текста песен
- Размеры
- 3B
- Железо
- от: 1 видеокарта
ТекстRU2022–2026
Яндекс · Россия
Модели Яндекса, обученные с нуля с упором на русский язык и российские реалии. Новая AliceAI-Foundation 80B-A3B (Apache 2.0) — только базовая модель, инструкт-версии нет: её дообучают под свои задачи. Рядом экономичная AliceAI-T5 35B-A0.6B.
- Русскоязычный ассистент и чат-бот
- Ответы на вопросы по базе знаний компании
- Основа для дообучения под свою отрасль
- Размеры
- 8B – 100B
- Железо
- от: Ноутбук
3D2024–2026
NAVER LABS Europe · Франция (NAVER, Южная Корея)
Семейство, с которого началась 3D-реконструкция «в один проход» по паре или набору фото без калибровки камер. MASt3R добавил сопоставление точек и масштаб, MUSt3R и BLASt3R — работу с видео.
- 3D-сцена по нескольким фото без калибровки
- Сопоставление точек между снимками
- Построение карты по видео (SLAM)
- Размеры
- 0.57B – 0.69B
- Железо
- от: Ноутбук
Музыка и звукGGUF2022–2026
m-a-p (Multimodal Art Projection) · Великобритания / Китай
Энкодер музыки: превращает трек в числовое описание, по которому определяют жанр, настроение, тональность и ритм. MERT-v2 работает с целыми песнями до 6 минут.
- Автоматическая разметка музыкального каталога
- Поиск похожих треков
- Определение жанра, настроения и темпа
- Размеры
- 95M – 632M
- Железо
- от: Ноутбук
Голосовые ассистенты2026
Samsung · Южная Корея
Крошечные модели понимания звука для смартфона: слушают речь, музыку и звуки вокруг и отвечают текстом — описывают запись и отвечают на вопросы о ней. Работают прямо на устройстве, вопросы и ответы — на английском: других языков в обучающих данных нет.
- Описание аудиозаписи словами
- Ответы на вопросы о звуке
- Определение типа звука и обстановки
- Размеры
- 99M – 356M
- Железо
- от: Ноутбук
Детекция подделок2023–2026
Adobe Research и University of Surrey · США
Водяной знак для картинок любого разрешения, сделанный для инициативы Content Authenticity: умеет и ставить метку, и снимать её. Детектор ошибается в обе стороны — вывод проверяет человек.
- Пометка изображений на выходе из своего пайплайна
- Проверка происхождения присланной картинки
- Связка с метаданными о происхождении контента
- Размеры
- варианты моделей Q и P, разная ёмкость метки
- Железо
- от: Ноутбук
ВидеоGGUF2025–2026
Sand AI · Китай
Видео, которое генерируется по кускам друг за другом, поэтому ролик можно продлевать бесконечно. MAGI-2 делает видео сразу со звуком.
- Длинные ролики с продолжением
- Видео со звуком
- Оживление изображений
- Размеры
- 4.5B – 114B-A6B
- Железо
- от: 1 видеокарта
Компьютерное зрение2024–2026
Microsoft Research · США
Восстанавливает 3D-геометрию сцены по одной фотографии: глубину в метрах, облако точек и нормали поверхностей.
- Замеры помещений и объектов по фото
- 3D-облако точек из снимка
- Подготовка данных для роботов и AR
- Размеры
- ViT-S – ViT-G
- Железо
- от: Ноутбук
Речь в текстGGUF2024–2026
Moonshine AI (Useful Sensors) · США
Очень маленькие и быстрые модели распознавания речи для телефонов, планшетов и встраиваемых устройств. Вторая версия работает потоково и выдаёт текст, пока человек ещё говорит.
- Голосовое управление устройствами
- Распознавание на телефоне без интернета
- Живые субтитры
- Размеры
- 27M – 245M
- Железо
- от: Ноутбук
Синтез речиGGUF2025–2026
bilibili · Китай
Синтез речи с клонированием голоса и точным контролем длительности, удобен для дубляжа видео. Управляет эмоциями отдельно от тембра.
- Дубляж видео с попаданием в тайминг
- Клонирование голоса
- Эмоциональная озвучка
- Размеры
- около 1B – 2B
- Железо
- от: Ноутбук
Текст2024–2026
Tencent · Китай
Языковые модели Tencent: от малых 0.5B–7B до Hy4-preview на 770 млрд параметров. С 2026 года линия переименована в Hy, а новые версии вышли под Apache 2.0.
- Корпоративный ассистент
- Перевод и работа с многоязычными текстами
- Агенты с инструментами
- Размеры
- 0.5B – 770B-A49B
- Железо
- от: Ноутбук
Голос: спикеры и звук2022–2026
Сообщество: Ultimate Vocal Remover (Anjok07), ZFTurbo, MVSep · Международное сообщество
Большая открытая коллекция моделей для отделения голоса от музыки и шумов: MDX-Net, BS-RoFormer, Mel-RoFormer, SCNet. Лидеры по качеству вокала среди открытых решений.
- Чистый голос из записи с музыкой
- Минусовки и стемы для караоке
- Удаление фоновой музыки и шума из роликов
- Размеры
- от десятков до сотен миллионов параметров
- Железо
- от: Ноутбук
Детекция подделок2025–2026
University of Michigan · США
Лёгкий детектор сгенерированных картинок, обученный на 2,7 млн примеров почти от 5000 разных генераторов. Ошибается в обе стороны: результат — повод для проверки человеком, а не доказательство.
- Проверка присланных фото и иллюстраций
- Фильтрация ИИ-картинок в потоке контента
- Разметка подозрительных изображений для ручной проверки
- Размеры
- 22M
- Железо
- от: Ноутбук
Детекция подделок2023–2026
University of Wisconsin-Madison · США
Ранний и до сих пор используемый подход: поверх замороженного CLIP обучается простой классификатор, который переносится на незнакомые генераторы. Ошибается в обе стороны — вывод требует проверки человеком.
- Проверка изображений от новых, незнакомых генераторов
- Базовая линия при сравнении детекторов
- Быстрое внедрение проверки без дообучения крупной модели
- Размеры
- линейный классификатор поверх CLIP ViT-L/14
- Железо
- от: Ноутбук
Видео2025–2026
Alibaba · Китай
Генерация видео по тексту и по картинке. Младшая версия запускается на игровой видеокарте. После 2.2 базовые модели открыто не выходят, только прикладные: монтаж (VACE), говорящие персонажи по звуку (S2V), танцы под музыку (Dancer).
- Короткие рекламные ролики
- Оживление фото товара
- Видео для соцсетей
- Размеры
- 1,3B – 14B
- Железо
- от: 1 видеокарта
КартинкиRU2022–2026
Сбер (Kandinsky Lab) · Россия
Российское семейство генерации картинок и видео от Сбера. Хорошо понимает запросы на русском и российский культурный контекст, открыто под MIT.
- Картинки по описанию на русском
- Короткие рекламные ролики из текста или фото
- Редактирование изображений по инструкции
- Размеры
- 2B – 19B
- Железо
- от: 1 видеокарта
КартинкиGGUF2025–2026
lodestones (независимый разработчик) · нет данных
Общественная модель, переобученная из FLUX.1-schnell с упрощённой архитектурой. Без цензуры стилей, популярна как база для дообучения.
- База для дообучения своих стилей
- Художественные иллюстрации
- Картинки для игр
- Размеры
- 4B – 8.9B
- Железо
- от: 1 видеокарта
Видео2024–2026
Lightricks · Израиль
Быстрая видеомодель, которая с LTX-2 генерирует видео сразу со звуком и речью. Можно управлять камерой и позой, есть облегчённые версии.
- Рекламные ролики со звуком
- Видео из фото товара
- Озвученные сцены для соцсетей
- Размеры
- 2B – 22B
- Железо
- от: 1 видеокарта
Видео2026
MiniMax · Китай
Открытые веса видеомодели Hailuo от MiniMax. Крупная модель на 33B, делает видео по тексту и картинке, но требует нескольких серверных видеокарт.
- Кинематографичные рекламные ролики
- Видео по тексту и картинке
- Сложные сцены с движением
- Размеры
- 33B + кодировщик 32B
- Железо
- от: Кластер
Роботы2025–2026
NVIDIA · США
Модели «мира» для роботов и беспилотников: генерируют реалистичное видео физических сцен и предсказывают действия. Cosmos 3 объединяет понимание, генерацию и управление.
- Синтетические видео для обучения роботов и беспилотников
- Проверка сценариев в симуляции
- Управление роботом (Policy-версии)
- Размеры
- 2B – 65B
- Железо
- от: 1 видеокарта
Голос: спикеры и звук2022–2026
Meta AI, затем Александр Дефоссе · Франция
Классическая модель, которая разделяет трек на голос, барабаны, бас и остальное. Версия v4 с гибридным трансформером остаётся эталоном; сейчас проект поддерживает автор в своём репозитории.
- Отделить голос от музыки в записи
- Минусовки и дорожки для караоке
- Очистка речи в видео с фоновой музыкой
- Размеры
- десятки миллионов параметров
- Железо
- от: Ноутбук
Голос: спикеры и звук2023–2026
Сообщество RVC-Project · Китай
Самый массовый открытый инструмент конверсии голоса: модель под конкретный голос учится за 10–30 минут записи, работает в реальном времени. Использовать только с согласия владельца голоса.
- Озвучка контента одним фирменным голосом
- Перепевка и работа с вокалом
- Смена голоса в реальном времени
- Размеры
- десятки миллионов параметров
- Железо
- от: Ноутбук
Картинка + текст2026
OpenMOSS (Фуданьский университет) · Китай
Модель «картинка + видео + текст» с упором на длинные видео и точную привязку событий к секундам. Есть версия Realtime для потокового видео в реальном времени.
- Разбор длинных видео и поиск событий по времени
- Потоковый анализ видео в реальном времени
- Понимание фото и документов
- Размеры
- около 11B
- Железо
- от: 1 видеокарта
КартинкиGGUF2026
Krea · США
Модель картинок на 12B с упором на реализм без глянцевого «ИИ-вида». Turbo-версия выдаёт 2K-картинку за пару секунд.
- Реалистичные фото для рекламы
- Картинки высокого разрешения
- Дообучение стилей
- Размеры
- 12B
- Железо
- от: 1 видеокарта
КартинкиGGUF2026
Ideogram · Канада
Открытые веса модели Ideogram, известной точной типографикой. Под некоммерческой лицензией: для бизнеса подходит только для тестов.
- Тестирование генерации с текстом
- Исследования и прототипы
- Размеры
- около 9B
- Железо
- от: 1 видеокарта
Речь в текстRUGGUF2026
Alibaba (Qwen) · Китай
Модели распознавания речи от команды Qwen на 50+ языков, включая русский. Хорошо справляются с шумом, пением и акцентами.
- Расшифровка звонков и встреч
- Субтитры к видео
- Распознавание на нескольких языках
- Размеры
- 0.6B – 1.7B
- Железо
- от: Ноутбук
Речь в текстGGUF2026
Cohere · Канада
Модель распознавания речи от Cohere на 14 языков (русского в списке нет), отдельная версия для арабского. Рассчитана на точную расшифровку деловых записей.
- Расшифровка встреч и интервью
- Субтитры
- Поиск по аудиоархиву
- Размеры
- 2B
- Железо
- от: Ноутбук
Синтез речиRUGGUF2025–2026
Boson AI · США
Выразительный синтез речи и диалогов с клонированием голоса, плюс модели распознавания. Третья версия синтеза поддерживает около 100 языков, включая русский, но некоммерческая.
- Выразительная озвучка роликов
- Озвучка диалогов
- Клонирование голоса
- Размеры
- около 3B – 8B
- Железо
- от: 1 видеокарта
Синтез речиRUGGUF2025–2026
Zyphra · США
Синтез речи с клонированием голоса и тонкой настройкой эмоций, скорости и высоты голоса.
- Клонирование голоса
- Эмоциональная озвучка
- Озвучка роликов
- Размеры
- около 1.6B
- Железо
- от: Ноутбук
Музыка и звукRUGGUF2025–2026
ACE Studio и StepFun · Китай
Быстрая генерация песен с вокалом на 19 языках, включая русский: полная песня за секунды, правка отдельных фрагментов и смена стиля.
- Песни и джинглы для рекламы
- Фоновая музыка для роликов
- Демо-версии композиций
- Размеры
- около 2B – 4B
- Железо
- от: Ноутбук
ТекстRUGGUF2025–2026
MiniMax · Китай
Крупные MoE-модели с очень длинным контекстом (до 1 млн токенов у Text-01 и M3). M3 — мультимодальная, понимает картинки. Лицензии сильно различаются от версии к версии.
- Анализ больших архивов документов за один запрос
- Агенты с инструментами
- Помощь программистам
- Размеры
- 230B-A10B – 456B-A46B
- Железо
- от: Кластер
Картинка + текст2023–2026
Shanghai AI Lab (OpenGVLab) · Китай
Семейство моделей для видео: энкодеры для поиска и классификации роликов и чат-модели, которые разбирают длинные видео. InternVideo 3 рассчитан на многочасовые записи.
- Поиск по видеоархиву текстовым запросом
- Распознавание действий на видео
- Ответы на вопросы по длинной записи
- Размеры
- малые энкодеры – 9B
- Железо
- от: Ноутбук
ВидеоGGUF2025–2026
Zhipu AI (Z.ai) и Университет Цинхуа · Китай
Анимирует персонажа с картинки по движениям из другого видео, в том числе сложные развороты и несколько персонажей. SCAIL-2 работает без промежуточного скелета и умеет заменять персонажа в ролике.
- Перенос движений актёра на персонажа
- Замена персонажа в готовом видео
- Анимация маскотов и иллюстраций
- Размеры
- 14B
- Железо
- от: 1 видеокарта
КартинкиGGUF2025–2026
HiDream.ai · Китай
Открытые модели картинок под MIT: генерация (I1), редактирование по инструкции (E1) и единая модель O1-Image, которая делает и то и другое.
- Генерация картинок по описанию
- Правка изображений словами
- Вариации продуктовых фото
- Размеры
- около 9B – 17B
- Железо
- от: 1 видеокарта
АватарыGGUF2025–2026
Meituan · Китай
Говорящие люди по аудио на базе LongCat-Video. Версия 1.5 доведена до продакшна: стабильные длинные ролики на китайском и английском.
- Видео с ведущим новостей или курса
- Промо-ролики с говорящим персонажем
- Пение и озвучка
- Размеры
- на базе LongCat-Video 13.6B
- Железо
- от: 1 видеокарта
3D2024–2026
VAST (TripoSR — вместе со Stability AI) · Китай
Семейство VAST: 3D-модель по одной фотографии. TripoSR работает меньше секунды, TripoSG даёт более чистую геометрию, TripoSplat строит сцену из гауссовых точек.
- 3D-модель товара по фото
- Заготовки объектов для игр и AR
- Быстрый 3D-прототип для печати
- Размеры
- до 1.5B
- Железо
- от: Ноутбук
Речь в текстRU2023–2026
NVIDIA · США
Быстрые модели распознавания речи от NVIDIA, в том числе потоковые для работы в реальном времени. Parakeet TDT v3 и Nemotron 3.5 ASR понимают русский.
- Расшифровка звонков и совещаний
- Субтитры к видео
- Голосовой ввод в реальном времени
- Размеры
- 110M – 2.5B
- Железо
- от: Ноутбук
Синтез речиRUGGUF2025–2026
Resemble AI · США
Синтез речи с клонированием голоса и настройкой эмоциональности. Многоязычная версия поддерживает 23 языка, включая русский; Turbo и Flash ускорены для живого диалога.
- Голос для бота и ассистента
- Клонирование фирменного голоса
- Озвучка роликов
- Размеры
- около 350M – 500M
- Железо
- от: Ноутбук
Синтез речиRU2025–2026
OpenMOSS (Фуданьский университет) · Китай
Семейство синтеза речи: озвучка диалогов на несколько голосов (TTSD), быстрый синтез для живого общения и крошечная Nano. Версия 1.5 поддерживает 30+ языков, включая русский.
- Озвучка подкастов и диалогов
- Голос для ассистента
- Клонирование голоса
- Размеры
- 100M – 8.5B
- Железо
- от: Ноутбук
Музыка и звукGGUF2024–2026
Stability AI · Великобритания
Генерация коротких музыкальных фрагментов и звуковых эффектов по описанию. Третья версия разделена на модели для музыки и для звуков.
- Звуковые эффекты для роликов и игр
- Фоновая музыка и джинглы
- Звуки для интерфейсов
- Размеры
- около 0.5B – 2.3B
- Железо
- от: Ноутбук
Обработка фото2023–2026
BRIA AI · Израиль
Удаление фона от BRIA, обучено на лицензированных фото. Мягкие края, волосы, прозрачность. Есть версии для видео. Для бизнеса нужен платный договор.
- Вырезка товара на белый фон
- Фото сотрудников и экспертов без фона
- Удаление фона на видео
- Размеры
- 44M – 220M
- Железо
- от: Ноутбук
Картинка + текстGGUF2025–2026
Kuaishou · Китай
Модели зрения от Kuaishou с упором на короткие видео. Keye-VL-2.0 (30B, активны 3B) хорошо понимает, что и когда происходит в ролике.
- Разбор и описание коротких видео
- Проверка роликов и контента
- Поиск нужного момента в видео
- Размеры
- 8B – 671B-A37B
- Железо
- от: Ноутбук
Синтез речиRU2025–2026
Supertone · Южная Корея
Очень быстрый лёгкий синтез речи для работы прямо на устройстве, без видеокарты и облака. Supertonic 3 говорит на 31 языке, включая русский.
- Озвучка ответов голосового бота на обычном сервере
- Озвучка в офлайн- и мобильных приложениях
- Чтение текстов и уведомлений вслух
- Размеры
- около 99M
- Железо
- от: Ноутбук
3D2025–2026
Meta и Оксфордский университет (VGG) · США / Великобритания
Восстанавливает 3D-сцену по одной, нескольким или сотням фотографий за секунды: положение камер, глубину и облако точек. Лучшая статья CVPR 2025.
- 3D-модель помещения или объекта по серии фото
- Определение положения камер для фотограмметрии
- Облако точек для обмеров и сравнения с планом
- Размеры
- около 1.2B
- Железо
- от: 1 видеокарта
Компьютерное зрение2024–2026
Meta · США
Модели Meta для анализа человека на фото: ключевые точки позы, разметка частей тела, нормали и глубина. Sapiens2 обучены на высоком разрешении и добавили маттинг людей.
- Определение позы и ключевых точек тела
- Разметка частей тела и одежды
- Отделение человека от фона
- Размеры
- 0.1B – 5B
- Железо
- от: Ноутбук
Аватары2024–2026
Фуданьский университет · Китай
Серия говорящих портретов по аудио: от коротких клипов до часовых видео в 4K. Hallo-Live рассчитана на работу в реальном времени.
- Видео с ведущим по фото и аудио
- Длинные обучающие ролики
- Живой аватар
- Размеры
- около 1B – 5B
- Железо
- от: 1 видеокарта
3D2025–2026
Tencent · Китай
Генерация целых 3D-миров и сцен по тексту или картинке, по которым можно ходить. Вторая версия собирает сцену из видео и фото.
- 3D-сцены для игр и виртуальных туров
- Фоны и окружение для видеопродакшна
- Черновики локаций для симуляций
- Размеры
- набор из нескольких моделей
- Железо
- от: 1 видеокарта
Синтез речиRUGGUF2025–2026
OpenBMB (ModelBest, Университет Цинхуа) · Китай
Синтез речи с клонированием голоса и естественной интонацией. VoxCPM2 поддерживает 30 языков, включая русский.
- Клонирование голоса
- Озвучка роликов и аудиокниг
- Голос для ассистента
- Размеры
- 0.5B – 2.3B
- Железо
- от: Ноутбук
Синтез речи2025–2026
Kyutai · Франция
Потоковые модели распознавания и синтеза речи от авторов Moshi: начинают говорить и расшифровывать, не дожидаясь конца фразы. Pocket TTS (100M) работает на процессоре. Английский, французский и ещё несколько европейских языков, русского нет.
- Потоковая расшифровка речи для голосовых ботов
- Озвучка ответов с минимальной задержкой
- Синтез речи на сервере без видеокарты (Pocket TTS)
- Размеры
- 100M (Pocket TTS) – 2.6B
- Железо
- от: Ноутбук
Голосовые ассистенты2024–2026
NVIDIA · США
Модели, которые слушают речь, звуки и музыку и отвечают на вопросы о них. Audio Flamingo Next разбирает записи до 30 минут. Только для исследований.
- Подробное описание аудиозаписей
- Вопросы и ответы по длинной записи
- Разметка музыки и звуков
- Размеры
- 0.5B – 8B
- Железо
- от: Ноутбук
Компьютерное зрение2023–2026
Meta · США
Выделяет любой объект на фото и видео по клику или рамке. Основа для удаления фона и подсчёта объектов.
- Удаление фона с фото товара
- Подсчёт объектов на фото
- Разметка данных для обучения
- Размеры
- 91M – ~0,85B
- Железо
- от: Ноутбук
Речь в текстRUGGUF2025–2026
Mistral AI · Франция
Речевые модели Mistral: понимают аудио, расшифровывают и отвечают на вопросы по записи. Realtime-версия распознаёт в реальном времени и поддерживает русский; есть синтез речи.
- Расшифровка и краткое содержание записей
- Вопросы к аудио
- Распознавание в реальном времени
- Размеры
- 3B – 24B
- Железо
- от: Ноутбук
Синтез речиRU2024–2026
Fish Audio · США / Китай
Синтез речи с клонированием голоса и управлением эмоциями на 80+ языках, включая русский. Качество близко к платным сервисам, но веса только для исследований.
- Клонирование голоса
- Эмоциональная озвучка
- Озвучка на многих языках
- Размеры
- 0.5B – около 4.5B
- Железо
- от: Ноутбук
Текст2025–2026
Reka AI · США
Компактные модели Reka: Flash 3 на 21B для рассуждений и Reka Edge на 7B, которая быстро разбирает изображения и видео на устройстве.
- Разбор фото и видео (Edge)
- Поиск объектов на изображениях
- Задачи с рассуждением (Flash)
- Размеры
- 7B – 21B
- Железо
- от: Ноутбук
Голос: спикеры и звукRU2026
FireRedTeam (Xiaohongshu) · Китай
Детектор речи и звуковых событий: отличает речь, пение и музыку. В тесте на 102 языках (набор FLEURS, русский входит) обошёл Silero VAD и TEN VAD. Есть потоковый режим.
- Нарезка записей перед распознаванием речи
- Отделение речи от музыки и пения в эфирах и роликах
- Определение речи в голосовых ботах
- Размеры
- компактная, точный размер не указан
- Железо
- от: Ноутбук
Синтез речиRU2026
k2-fsa (Next-gen Kaldi) · Китай
Синтез речи с клонированием голоса по короткому образцу на 646 языках, включая русский и языки народов России. Можно описать голос словами. Веса только для некоммерческого использования.
- Озвучка на редких языках
- Клонирование голоса по образцу
- Исследования и прототипы многоязычной озвучки
- Размеры
- 0.6B
- Железо
- от: Ноутбук
Видео2025–2026
Skywork AI (Kunlun) · Китай
Интерактивная «модель мира»: генерирует видео игрового мира в реальном времени и реагирует на нажатия клавиш и мышь. Версия 3.0 держит память о сцене минутами.
- Прототипы игровых миров без движка
- Интерактивные демо и симуляции
- Генерация данных для обучения агентов
- Размеры
- 1.8B – 17B
- Железо
- от: 1 видеокарта
Обработка фото2025–2026
S-Lab, Наньянский технологический университет · Сингапур
Вырезает человека из видео с точной альфа-маской, включая волосы и края, без зелёного фона. Нужна маска первого кадра, например из SAM.
- Замена фона на видео без хромакея
- Вырезание человека для монтажа и эффектов
- Подготовка роликов для рекламы и соцсетей
- Размеры
- около 35M
- Железо
- от: Ноутбук
Музыка и звук2025–2026
Alibaba Tongyi (FunAudioLLM) · Китай
Генерирует и редактирует звук к видео, тексту или аудио, сначала «рассуждая» о сцене через мультимодальную модель. PrismAudio — следующая версия для звука к видео.
- Звук к видео по сцене
- Редактирование отдельных звуков в дорожке
- Звуковые эффекты по описанию
- Размеры
- размер на карточке не указан
- Железо
- от: 1 видеокарта
Аватары2026
SII-GAIR и Sand.ai · Китай
Генерирует видео с говорящим человеком сразу со звуком: один трансформер обрабатывает текст, видео и аудио. Речь на 7 языках, русского в списке нет. Есть дистиллированные быстрые версии.
- Видео с ведущим по сценарию
- Рекламные ролики с говорящим персонажем
- Обучающие видео с диктором
- Размеры
- 15B
- Железо
- от: 1 видеокарта
КартинкиGGUF2024–2026
Black Forest Labs · Германия
Генерация картинок от авторов Stable Diffusion. Хорошо рисует текст на изображении и держит композицию.
- Картинки для карточек товаров
- Баннеры и обложки
- Редактирование фото по описанию (Kontext)
- Размеры
- 4B – 32B
- Железо
- от: 1 видеокарта
КартинкиGGUF2024–2026
Tencent · Китай
Модели картинок Tencent. HunyuanImage 3.0 — крупнейшая открытая MoE-модель генерации на 80B, умеет рассуждать над запросом и редактировать по инструкции.
- Сложные сцены по длинному описанию
- Картинки с текстом на китайском и английском
- Редактирование изображений по инструкции
- Размеры
- 1.5B – 80B-A13B
- Железо
- от: 1 видеокарта
КартинкиGGUF2025–2026
Alibaba (Tongyi-MAI) · Китай
Компактная модель на 6B с фотореализмом уровня крупных моделей. Turbo-версия выдаёт картинку за несколько шагов на обычной игровой видеокарте.
- Фотореалистичные рекламные картинки
- Картинки с текстом на английском и китайском
- Массовая генерация визуалов
- Размеры
- 6B
- Железо
- от: 1 видеокарта
ВидеоGGUF2025–2026
Skywork AI (Kunlun Tech) · Китай
Видеомодели для кинематографичных сцен с людьми. Умеют ролики неограниченной длины, продление видео и говорящих персонажей по аудио.
- Длинные ролики с продолжением
- Видео с одним персонажем по референсу
- Говорящий аватар по голосу
- Размеры
- 1.3B – 19B
- Железо
- от: 1 видеокарта
Синтез речиRUGGUF2026
Alibaba (Qwen) · Китай
Синтез речи на 10 языках, включая русский: клонирование голоса по 3 секундам, готовые голоса и создание голоса по текстовому описанию.
- Голос для бота и ассистента
- Клонирование фирменного голоса
- Подбор голоса по описанию
- Размеры
- 0.6B – 1.7B
- Железо
- от: Ноутбук
ВидеоGGUF2026
OpenMOSS / MOSI · Китай
Генерирует видео сразу со звуком: речь с синхронными губами, эффекты и окружение в одном проходе. MoE-архитектура на 32B параметров, есть версии 360p и 720p.
- Короткие ролики с речью и звуком по описанию
- Рекламные сцены с диалогами
- Прототипы видео для сторибордов
- Размеры
- 32B-A18B
- Железо
- от: 1 видеокарта
3DGGUF2024–2025
Microsoft · США
Одна из сильнейших открытых 3D-моделей: по картинке или тексту выдаёт сетку с текстурой или гауссову сцену. TRELLIS.2 заметно детальнее первой версии.
- 3D-модели товаров и интерьера по фото
- Ассеты для игр и AR/VR
- Прототипы для 3D-печати
- Размеры
- до 4B (TRELLIS.2)
- Железо
- от: 1 видеокарта
Компьютерное зрениеGGUF2024–2025
ByteDance и Гонконгский университет · Китай
Определяет глубину — расстояние до каждой точки — по одной обычной фотографии или видео. DA3 восстанавливает геометрию сцены с нескольких кадров.
- Оценка расстояний и объёмов по камере
- Эффекты глубины для фото и видео
- Навигация роботов и дронов
- Размеры
- 25M – 1.4B
- Железо
- от: Ноутбук
Речь в текстRU2025
Meta · США
Распознавание речи на 1600+ языках, включая русский и редкие языки, которые раньше не поддерживала ни одна система. Новый язык можно добавить по нескольким примерам.
- Расшифровка на редких и местных языках
- Оцифровка устных архивов
- Субтитры на многих языках
- Размеры
- 300M – 7B
- Железо
- от: Ноутбук
Речь в текст2024–2025
Alibaba (Tongyi, FunAudioLLM) · Китай
Набор моделей Alibaba для быстрого распознавания речи, в первую очередь китайской и азиатских языков. SenseVoice дополнительно определяет эмоции и звуковые события.
- Расшифровка звонков
- Определение эмоций в голосе
- Распознавание смеха, музыки и других звуков
- Размеры
- около 230M – 800M
- Железо
- от: Ноутбук
Синтез речиRU2024–2025
Alibaba (Tongyi, FunAudioLLM) · Китай
Синтез речи с клонированием голоса по короткому образцу и потоковой выдачей для живого диалога. Третья версия поддерживает 9 языков, включая русский.
- Голос для бота и ассистента
- Клонирование фирменного голоса
- Озвучка роликов
- Размеры
- 300M – 0.5B
- Железо
- от: Ноутбук
Текст2025
Naver · Южная Корея
Открытые младшие модели корейского Naver: от 0.5B до 32B, включая рассуждающие Think и мультимодальные версии с пониманием картинок.
- Лёгкий корейско-английский ассистент
- Разбор картинок и документов
- Классификация текстов
- Размеры
- 0.5B – 32B
- Железо
- от: Ноутбук
Голос: спикеры и звук2025
Meta · США
Модель вырезает из записи нужный звук по текстовому описанию, по отметке на видео или по отрезку: голос, инструмент, шум. Доступ к весам выдают по заявке.
- Выделить голос одного человека из шумной записи
- Убрать посторонний звук из видео
- Разобрать запись на отдельные источники звука
- Размеры
- small, base, large (от 5 до 15 ГБ весов)
- Железо
- от: 1 видеокарта
3D2025
Meta и Университет Карнеги — Меллон · США
Одна модель собирает метрическую 3D-реконструкцию из фото, а если есть данные о камерах, глубине или позах — учитывает и их. Есть версия весов под Apache 2.0.
- 3D-реконструкция объекта или помещения по фото
- Экспорт сцены в формат COLMAP для дальнейшей обработки
- Оценка глубины и положения камер
- Размеры
- около 1.2B
- Железо
- от: 1 видеокарта
3D2025
Shanghai AI Lab · Китай
Восстанавливает 3D-сцену и положения камер по набору фото или видео, не опираясь на «опорный» кадр. Pi3X даёт более гладкие облака точек и примерный масштаб в метрах.
- 3D-реконструкция сцены по видео
- Оценка положения камеры по кадрам
- Облака точек для исследований и прототипов
- Размеры
- 0.96B – 1.4B
- Железо
- от: 1 видеокарта
3D2025
Tencent Hunyuan · Китай
Генерирует 3D-анимацию движения человека по текстовому описанию: скелетная анимация сразу подходит для 3D-редакторов и игровых движков. Понимает английский и китайский.
- Анимация персонажа по текстовому описанию
- Черновая анимация для игр и роликов
- Библиотека движений для аватаров
- Размеры
- 0.46B – 1B
- Железо
- от: 1 видеокарта
Компьютерное зрение2025
Meta · США
Семейство энкодеров Meta для картинок и видео, а с версией PE-AV — и для звука. PE-Core ищет по тексту точнее SigLIP 2 (по данным Meta), есть малые версии.
- Поиск фото и видео по описанию
- Разметка и теги каталога
- Поиск по звуку и видео (PE-AV)
- Размеры
- размер на карточке не указан
- Железо
- от: Ноутбук
Детекция подделок2024–2025
Meta · США
Водяной знак для видео и картинок, устойчивый к перекодированию и обрезке. Детектор ошибается в обе стороны: отсутствие метки не доказывает подделку, а её находка — повод для проверки человеком.
- Пометка видео, созданного или обработанного ИИ
- Поиск своей метки в перезалитых роликах
- Защита рекламных материалов от переприсвоения
- Размеры
- метка от 96 до 1024 бит
- Железо
- от: Ноутбук
ВидеоGGUF2024–2025
Tencent · Китай
Видеомодель Tencent, одна из первых открытых на уровне закрытых сервисов. Версия 1.5 стала легче (8.3B) и идёт на потребительских картах.
- Видео по текстовому сценарию
- Оживление изображений
- База для дообучения своих видеомоделей
- Размеры
- 8.3B – 13B
- Железо
- от: 1 видеокарта
3DGGUF2025
Meta · США
Восстанавливает 3D-форму предмета или тела человека по одной обычной фотографии, даже если объект частично закрыт. Две модели: Objects и Body.
- 3D-модель предмета с фото из каталога
- Оценка позы и формы тела по фото
- Примерка и AR-сценарии
- Размеры
- н/д
- Железо
- от: 1 видеокарта
Синтез речи2025
Nari Labs · Южная Корея
Модель, которая озвучивает целые диалоги на два голоса со смехом, вздохами и паузами. Только английский.
- Озвучка диалогов и подкастов
- Рекламные ролики с живой речью
- Сценки для обучения
- Размеры
- 1B – 2B
- Железо
- от: Ноутбук
Голос: спикеры и звукRU2020–2025
Silero · Россия
Самый популярный открытый детектор речи: отличает голос от тишины и шума. Обрабатывает фрагмент звука меньше чем за миллисекунду на одном ядре процессора, обучен на записях более чем 6000 языков.
- Нарезка звонков и записей перед распознаванием речи
- Определение, когда клиент говорит, в голосовом боте
- Отсев тишины и шума, экономия на расшифровке
- Размеры
- около 2 МБ
- Железо
- от: Ноутбук
Видео2025
Character.AI · США
Генерирует видео вместе со звуком и речью по тексту или картинке: две ветви (видео на базе Wan 2.2 и аудио 5B) работают синхронно. Нужно 24–32 ГБ видеопамяти.
- Короткие ролики с говорящими персонажами
- Оживление картинки с озвучкой
- Прототипы рекламных сцен
- Размеры
- 11B
- Железо
- от: 1 видеокарта
Компьютерное зрение2023–2025
Meta · США
Открытый повтор CLIP от Meta с прозрачным рецептом сбора данных. MetaCLIP 2 обучен на многоязычных данных со всего мира. Только некоммерческая лицензия.
- Поиск картинок по тексту
- Классификация изображений без обучения
- Исследования и прототипы поиска
- Размеры
- 0.15B – 3.6B
- Железо
- от: Ноутбук
ВидеоGGUF2025
Meituan · Китай
Видеомодель на 13.6B: из текста, из картинки и продолжение видео. Держит качество на роликах в несколько минут.
- Длинные ролики
- Видео из фото
- Продолжение готового видео
- Размеры
- 13.6B
- Железо
- от: 1 видеокарта
Музыка и звук2025
ASLP-lab (Северо-Западный политехнический университет) · Китай
Быстрая генерация полной песни с вокалом по тексту и образцу стиля, до нескольких минут звучания.
- Песни и джинглы по тексту
- Музыка для роликов
- Демо-версии композиций
- Размеры
- около 1.1B
- Железо
- от: Ноутбук
Детекция подделок2025
National Institute of Informatics, Yamagishi Lab · Япония
Семь речевых энкодеров (wav2vec 2.0, XLS-R, MMS, HuBERT), дообученных различать живую и синтезированную речь. Разработчики сами отмечают: качество сильно зависит от набора данных, вывод проверяет человек.
- Проверка аудиозаписей на синтез
- Дообучение под свой язык и канал записи
- Сравнение нескольких энкодеров на своих данных
- Размеры
- 0,3B – 2B
- Железо
- от: Ноутбук
3D2024–2025
Tencent · Китай
Открытая 3D-линейка Tencent: форма и текстура по картинке, качество на уровне платных сервисов. Omni добавляет управление позой и формой, Part делит модель на детали.
- 3D-модели товаров с текстурой
- Персонажи и предметы для игр
- Разделение модели на детали для печати
- Размеры
- набор моделей: форма и текстуры
- Железо
- от: 1 видеокарта
Речь в текстRU2023–2025
Alpha Cephei · Россия
Офлайн-распознавание русской речи, которое работает даже на Raspberry Pi и телефоне, без интернета. Есть потоковые модели для живого звука и простой русский синтез речи Vosk TTS.
- Расшифровка звонков и записей на русском без облака
- Голосовое управление в приложениях и киосках
- Распознавание речи в потоке с малой задержкой
- Размеры
- около 45 МБ – 1,8 ГБ
- Железо
- от: Ноутбук
Голосовые ассистентыRUGGUF2025
Alibaba (Qwen) · Китай
Модели, которые понимают текст, картинки, аудио и видео и отвечают голосом в реальном времени. Qwen3-Omni говорит на 10 языках, включая русский.
- Голосовой ассистент для клиентов
- Разбор звонков и видео
- Ответы голосом по документам и картинкам
- Размеры
- 3B – 30B-A3B
- Железо
- от: Ноутбук
Голос: спикеры и звук2022–2025
pyannoteAI (Эрве Бредин) · Франция
Самый распространённый открытый инструмент, который размечает запись по спикерам: кто и когда говорил. Обычно ставится в связку с распознаванием речи. Веса выдаются после короткой анкеты на HF.
- Разметка звонков: где оператор, где клиент
- Протоколы совещаний с подписью спикеров
- Подготовка записей к расшифровке и анализу
- Размеры
- несколько миллионов параметров
- Железо
- от: Ноутбук
Музыка и звук2025
Tencent Hunyuan · Китай
Генерирует звук студийного качества (48 кГц) к видео по картинке и текстовой подсказке: шаги, удары, окружение, синхронно с действием в кадре.
- Фоли и звуковые эффекты к видео
- Озвучка ИИ-роликов для рекламы
- Саунд-дизайн для коротких видео
- Размеры
- не указан в карточке (веса около 10 ГБ; XL-версия с выгрузкой в память)
- Железо
- от: 1 видеокарта
Детекция подделок2023–2025
IBM Research и The Chinese University of Hong Kong · США
Детектор ИИ-текста, обученный вместе с перефразировщиком: его специально учили не сдаваться, когда текст переписали своими словами. Ошибается в обе стороны, вывод проверяет человек.
- Проверка текстов, которые могли переписать после генерации
- Предварительный отсев в редакции или приёмной комиссии
- Сравнение с более простыми детекторами
- Размеры
- около 355M (RoBERTa-large)
- Железо
- от: Ноутбук
Аватары2025
Meituan · Китай
Дубляж и говорящие персонажи на базе Wan: MultiTalk ведёт диалог нескольких людей, InfiniteTalk переозвучивает видео любой длины с мимикой и телом.
- Дубляж видео с подгонкой мимики
- Диалог двух персонажей по аудио
- Длинные ролики с ведущим
- Размеры
- 14B
- Железо
- от: 1 видеокарта
Голос: спикеры и звук2024–2025
Alibaba (Tongyi Lab) · Китай
Набор моделей Alibaba для чистки речи: шумоподавление, разделение наложенных голосов, повышение качества звука до 48 кГц и выделение голоса по видео с лицом говорящего.
- Шумоподавление записей разговоров
- Разделение двух голосов, говорящих одновременно
- Улучшение старых и телефонных записей
- Размеры
- менее 1B
- Железо
- от: Ноутбук
Синтез речиRU2025
ESpeech (независимая группа русскоязычных разработчиков) · Россия
Русский синтез речи с клонированием голоса на архитектуре F5-TTS, обучен на собранных авторами наборах русской речи. Ударения расставляются автоматически. Несколько вариантов, в том числе «подкастер».
- Озвучка роликов и аудиокниг на русском
- Клонирование голоса диктора по образцу
- Голос для бота или ассистента на русском
- Размеры
- около 340M
- Железо
- от: Ноутбук
Видео2025
Tencent Hunyuan · Китай
Делает из одной картинки управляемое видео игровой сцены: камера движется по командам клавиатуры. Минимум 24 ГБ видеопамяти, рекомендовано 80 ГБ.
- Интерактивные видео-прототипы игровых локаций
- Ролики с проходом камеры по сцене
- Демо уровней для питчей
- Размеры
- на базе HunyuanVideo
- Железо
- от: 1 видеокарта
Детекция подделок2023–2025
The Chinese University of Hong Kong, Shenzhen (SCLBD) · Китай
Набор из десятков открытых детекторов подмены лица на видео и фото под общим кодом и с готовыми весами. Детектор ошибается в обе стороны: его вывод — повод для проверки человеком, а не доказательство подделки.
- Первичная проверка присланного видео или селфи
- Сравнение нескольких детекторов на своих данных
- Дообучение детектора под свой поток заявок
- Размеры
- детекторы уровня Xception и EfficientNet, десятки миллионов параметров
- Железо
- от: Ноутбук
ПереводRUGGUF2025
ByteDance Seed · Китай
Компактный переводчик ByteDance на 28 языков, по качеству близкий к крупным закрытым системам. Русский есть. Есть готовые сжатые версии.
- Перевод деловой переписки и документов
- Перевод карточек товаров
- Перевод технических и юридических текстов
- Размеры
- 7B
- Железо
- от: Ноутбук
Обработка фотоGGUF2024–2025
Нанькайский университет · Китай
Открытая модель точного выделения объекта и удаления фона под лицензией MIT. На ней построен RMBG-2.0. Есть версии для 2K и для волос и полупрозрачных краёв.
- Удаление фона с фото товаров потоком
- Точные маски для дизайна и печати
- Вырезка людей с волосами для рекламы
- Размеры
- около 220M (есть облегчённые lite)
- Железо
- от: Ноутбук
Детекция подделок2024–2025
Meta · США
Водяной знак для картинок, который можно поставить на отдельные участки: модель показывает, какая часть изображения помечена. Ошибается в обе стороны — итог проверяет человек.
- Пометка сгенерированных и отредактированных изображений
- Поиск помеченного фрагмента в коллаже
- Отслеживание, какие части картинки сделал ИИ
- Размеры
- кодировщик и декодировщик метки для изображений
- Железо
- от: Ноутбук
КартинкиGGUF2024–2025
BAAI (Пекинская академия ИИ) · Китай
Универсальная модель: генерирует, редактирует, переносит объект или человека с фото в новую сцену без отдельных плагинов.
- Перенос товара или человека в новую сцену
- Редактирование фото по инструкции
- Генерация по нескольким референсам
- Размеры
- около 4B
- Железо
- от: 1 видеокарта
Обработка фото2025
ByteDance Seed · Китай
Восстановление и увеличение видео и фото от ByteDance. SeedVR2 делает это за один шаг, поэтому заметно быстрее похожих моделей. Коммерческая лицензия.
- Увеличение фото и видео до 2K–4K
- Восстановление старых роликов и снимков
- Улучшение пользовательских фото перед публикацией
- Размеры
- 3B – 7B
- Железо
- от: 1 видеокарта
Голос: спикеры и звук2024–2025
RVC-Boss и сообщество · Китай
Синтез речи с клонированием голоса: хватает 5 секунд образца, а после дообучения на минуте записи голос звучит заметно точнее. Использовать только с согласия владельца голоса.
- Озвучка текстов голосом конкретного диктора
- Голос для бота или ассистента
- Дубляж обучающих роликов
- Размеры
- менее 1B
- Железо
- от: Ноутбук
Аватары2025
ByteDance · Китай
Подгоняет движения губ на готовом видео под новую озвучку. Версия 1.6 работает в 512 пикселей и даёт более чёткое лицо.
- Переозвучка роликов на другой язык с попаданием в губы
- Правка реплик в готовом видео без пересъёмки
- Говорящие аватары для обучающих курсов
- Размеры
- нужно 8–18 ГБ видеопамяти
- Железо
- от: Ноутбук
Детекция подделок2024–2025
Xiaohongshu, USTC и Shanghai Jiao Tong University · Китай
Детектор ИИ-картинок из нескольких экспертов: одни смотрят на визуальные артефакты, другие на шум. Вместе с ним выпущен сложный набор Chameleon. Ошибается в обе стороны — итог проверяет человек.
- Проверка реалистичных ИИ-изображений без явных артефактов
- Сравнение детекторов на сложных примерах
- Дообучение под свой тип контента
- Размеры
- несколько экспертов на базе ConvNeXt и CLIP
- Железо
- от: 1 видеокарта
АватарыGGUF2025
Tencent · Китай
Говорящие персонажи на базе HunyuanVideo: передаёт эмоции голоса, работает с несколькими персонажами и разными стилями.
- Видео с ведущим по фото и аудио
- Сцены с несколькими говорящими
- Мультяшные персонажи
- Размеры
- около 13B
- Железо
- от: 1 видеокарта
Голос: спикеры и звук2024–2025
Songting Liu (Plachtaa) · Китай
Конверсия голоса без обучения: переносит тембр по образцу в 1–30 секунд, умеет петь и работать в реальном времени, V2 меняет и акцент. Использовать только с согласия владельца голоса.
- Переозвучка ролика другим голосом
- Анонимизация голоса в записях
- Голос в реальном времени для стримов
- Размеры
- около 70M – 200M
- Железо
- от: Ноутбук
Модерация и безопасность2023–2025
Falconsai и Freepik · США и Испания
Небольшие модели, которые отличают откровенные картинки от обычных. Freepik различает четыре уровня откровенности. Работают на процессоре.
- Фильтр пользовательских фото и аватаров
- Проверка картинок от генераторов перед публикацией
- Разметка медиатеки
- Размеры
- 86M
- Железо
- от: Ноутбук
Голосовые ассистенты2025
Moonshot AI · Китай
Универсальная аудиомодель: распознаёт речь, отвечает на вопросы о звуке, определяет эмоции и ведёт голосовой диалог. Обучена на 13 млн часов аудио, языки — английский и китайский.
- Распознавание речи
- Определение эмоций и звуковых событий
- Голосовой диалог речь-в-речь
- Размеры
- 7B
- Железо
- от: 1 видеокарта
Речь в текстRUGGUF2022–2025
OpenAI · США
Распознавание речи на 99 языках, включая русский. Стандарт де-факто для расшифровки звонков и встреч. Ускоренные Distil-Whisper от Hugging Face — только для английского.
- Расшифровка звонков и созвонов
- Субтитры к видео
- Голосовые сообщения в текст
- Размеры
- 39M – 1,5B
- Железо
- от: Ноутбук
Видео2024–2025
HPC-AI Tech · Сингапур
Полностью открытый проект видеогенерации: веса, код и рецепт обучения. Версия 2.0 на 11B делает видео из текста и из картинки.
- Видео по текстовому описанию
- Оживление картинок
- Обучение своей видеомодели
- Размеры
- до 11B
- Железо
- от: 1 видеокарта
Видео2025
StepFun · Китай
Крупная видеомодель на 30B с роликами до 204 кадров. Требует серверного железа, зато открыта под MIT.
- Видео по описанию
- Оживление изображений
- Размеры
- 30B
- Железо
- от: Кластер
Аватары2024–2025
Tencent Music (Lyra Lab) · Китай
Синхронизация губ в реальном времени: подгоняет рот на видео под новое аудио. Подходит для перевода видео и живых аватаров.
- Дубляж видео на другой язык
- Живой аватар в видеочате
- Правка речи в готовом ролике
- Размеры
- меньше 1B
- Железо
- от: Ноутбук
Синтез речиGGUF2024–2025
Шанхайский университет Цзяотун и партнёры · Китай
Модель клонирования голоса по нескольким секундам образца, английский и китайский. Сообщество выпустило много дообученных версий под другие языки, в том числе русский.
- Клонирование голоса
- Озвучка аудиокниг и роликов
- Исследования и прототипы
- Размеры
- около 340M
- Железо
- от: Ноутбук
Синтез речиGGUF2025
Canopy Labs · США
Синтез речи на основе языковой модели с живыми интонациями и эмоциональными вставками. Быстро отвечает, подходит для голосовых ассистентов. В основном английский.
- Голос для ассистента в реальном времени
- Эмоциональная озвучка
- Клонирование голоса
- Размеры
- 3B
- Железо
- от: Ноутбук
Синтез речиGGUF2025
Sesame · США
Модель разговорной речи, которая учитывает контекст беседы и звучит как живой собеседник. Только английский.
- Голос для разговорного ассистента
- Озвучка диалогов
- Прототипы голосовых продуктов
- Размеры
- 1B
- Железо
- от: Ноутбук
Лица2025
ByteDance · Китай
Генерация картинок с сохранением лица на базе FLUX: лучше следует описанию и реже копирует лицо как наклейку. Лицензия только исследовательская.
- Портреты по одному фото с точным описанием сцены
- Тесты персонажей для рекламы
- Сравнение методов сохранения лица
- Размеры
- адаптер к FLUX.1-dev
- Железо
- от: 1 видеокарта
Детекция подделок2025
Desklib · Индия
Свежий открытый детектор ИИ-текста на DeBERTa-v3-large, обучен на наборе RAID; есть отдельная версия под учебные работы. Ошибается в обе стороны — итог всегда проверяет человек.
- Проверка присланных статей и отчётов
- Отсев шаблонных отзывов и откликов
- Предварительная проверка учебных работ
- Размеры
- 0,4B (DeBERTa-v3-large)
- Железо
- от: Ноутбук
Компьютерное зрение2023–2025
Google · США
Модели, которые переводят картинки и текст в общее пространство: можно искать фото по словам и классифицировать изображения без обучения. CLIP от OpenAI (2021) — предшественник.
- Поиск картинок по текстовому запросу
- Автоматическая разметка и теги каталога
- Фильтрация недопустимого контента
- Размеры
- около 0.2B – 2B
- Железо
- от: Ноутбук
Синтез речиGGUF2024–2025
hexgrad (независимый разработчик) · не указана
Крошечная модель синтеза речи (82M), которая звучит на уровне крупных. Работает на обычном процессоре; английский и ещё несколько языков, русского нет.
- Озвучка статей и уведомлений
- Голос для приложений без видеокарты
- Массовая озвучка текстов
- Размеры
- 82M
- Железо
- от: Ноутбук
3D2024–2025
Stability AI · Великобритания
Модели Stability AI, которые за секунду превращают одну фотографию в 3D-модель с текстурой. SPAR3D позволяет поправить форму через облако точек.
- 3D-карточки товаров по фото
- Ассеты для игр и AR
- Быстрые макеты для дизайна
- Размеры
- 1B – 2B
- Железо
- от: 1 видеокарта
Обработка фото2024–2025
Prama LLC · США
Модель удаления фона с упором на сложные края: волосы, мех, тонкие детали. Открытая версия под MIT, умеет обрабатывать видео.
- Вырезка товара и людей с фото
- Удаление фона на видео
- Подготовка фото для каталога
- Размеры
- около 95M
- Железо
- от: Ноутбук
Картинка + текстGGUF2024–2025
DeepSeek · Китай
Одна модель и понимает картинки, и рисует их по описанию. Janus-Pro-7B была заметна в начале 2025 года, но по качеству картинок уступает специализированным моделям.
- Ответы на вопросы по картинкам
- Черновые иллюстрации по описанию
- Эксперименты с единой моделью зрения и генерации
- Размеры
- 1B – 7B
- Железо
- от: Ноутбук
Компьютерное зрение2022–2025
Сиднейский университет и JD Explore Academy · Австралия / Китай
Простая и точная модель определения позы человека по ключевым точкам. Версия ViTPose++ умеет позы людей, животных и всего тела; встроена в библиотеку Transformers.
- Ключевые точки тела на фото и видео
- Анализ движений в спорте и реабилитации
- Контроль рабочих поз и техники безопасности
- Размеры
- 33M – около 1B
- Железо
- от: Ноутбук
Картинка + текст2023–2025
Alibaba DAMO Academy · Китай
Модели, которые смотрят видео и отвечают на вопросы о нём: что происходит, в какой момент, кто что делает. VideoLLaMA 3 на 2B и 7B — одни из сильнейших в своём размере.
- Описание и краткий пересказ видео
- Поиск момента в записи по вопросу
- Разметка видеоархива
- Размеры
- 2B – 72B
- Железо
- от: Ноутбук
Примерка одежды2024
Meta AI (вместе с King's College London) · США
Модель Meta для примерки и смены позы человека на фото. Бережно переносит мелкие детали ткани и надписи. Лицензия MIT, но обучающие данные некоммерческие.
- Примерка одежды на фото модели
- Смена позы модели на уже снятом кадре
- Добор ракурсов для карточки товара
- Размеры
- на базе Stable Diffusion
- Железо
- от: 1 видеокарта
Музыка и звук2024
Иллинойсский университет и Sony AI · США / Япония
Озвучивает немое видео: генерирует шумы и звуковые эффекты, синхронные с происходящим в кадре, по видео и текстовой подсказке. Одна из первых сильных открытых моделей фоли.
- Звуковые эффекты к немому видео
- Озвучка роликов от ИИ-генераторов
- Черновой саунд-дизайн для монтажа
- Размеры
- размер на карточке не указан
- Железо
- от: Ноутбук
Музыка и звук2024
Tencent AI Lab · Китай
Музыкальный энкодер MuQ и модель MuQ-MuLan, которая сопоставляет музыку и текст: можно искать треки по описанию на английском или китайском.
- Поиск музыки по текстовому описанию
- Разметка треков по жанру и настроению
- Подбор похожей музыки
- Размеры
- 300M – 700M
- Железо
- от: Ноутбук
Детекция подделок2024
Meta · США
Незаметная метка в синтезированной речи и быстрый детектор, который находит её даже в куске длинной записи. Детектор ошибается в обе стороны: срабатывание — повод для проверки человеком, а не доказательство.
- Пометка речи, синтезированной вашим сервисом
- Поиск своей метки в чужих публикациях
- Проверка, не подмешан ли синтез в запись разговора
- Размеры
- генератор и детектор водяного знака, 16 бит сообщения
- Железо
- от: Ноутбук
Поиск по сканам документов2024
Alibaba (Tongyi Lab) · Китай
Один вектор и для текста, и для картинки, и для их пары: одной моделью можно искать товар по фото, страницу документа по вопросу и картинку по описанию. Языки в карточке: английский и китайский.
- Поиск товара по фотографии
- Поиск по каталогу картинок и карточек
- Поиск по страницам документов как по изображениям
- Размеры
- 2B и 7B
- Железо
- от: 1 видеокарта
Синтез речиGGUF2024
Hugging Face · США
Синтез речи, где голос задаётся текстовым описанием («спокойный женский голос, чистая запись»). Английский и 8 европейских языков, русского нет.
- Подбор голоса по описанию
- Озвучка роликов
- Прототипы голосовых сервисов
- Размеры
- 880M – 2.2B
- Железо
- от: Ноутбук
Музыка и звук2023–2024
Meta · США
Генерация инструментальной музыки по текстовому описанию или по мелодии-образцу. Одна из первых открытых моделей такого рода.
- Черновые музыкальные наброски
- Музыка для прототипов роликов
- Исследования
- Размеры
- 300M – 3.3B
- Железо
- от: Ноутбук
КартинкиGGUF2022–2024
Stability AI · Великобритания
Модель, с которой началась открытая генерация картинок. Огромная экосистема дообучений, стилей и плагинов, работает даже на домашнем ПК. Популярные ускорители SDXL-Lightning и Hyper-SD сделала ByteDance.
- Иллюстрации и баннеры для рекламы
- Фоны и сцены для карточек товаров
- Дообучение под фирменный стиль
- Размеры
- 0.9B – 8B
- Железо
- от: Ноутбук
ВидеоGGUF2024
Genmo · США
Открытая видеомодель на 10B с реалистичным движением. На момент выхода была одной из сильнейших открытых, сейчас обновлений нет.
- Видео по описанию
- Короткие рекламные сцены
- Размеры
- 10B
- Железо
- от: 1 видеокарта
Лица2024
ByteDance · Китай
Сохраняет лицо человека при генерации картинок по одному фото и меньше портит стиль и фон. Есть версии для SDXL и FLUX, вторая идёт на карте 16 ГБ.
- Портреты и аватары по одному фото
- Персонажи для рекламы с узнаваемым лицом
- Прототипы фотосессий
- Размеры
- адаптеры к SDXL и FLUX.1-dev
- Железо
- от: 1 видеокарта
Видео2022–2024
hzwer (Хуан Чжэвэй) и соавторы · Китай
Дорисовывает промежуточные кадры: превращает 24–30 кадров в секунду в 60 и больше и делает плавное замедление. Версии 4.24+ хорошо сглаживают видео от генеративных моделей.
- Повышение частоты кадров видео
- Плавное замедленное видео
- Сглаживание роликов от ИИ-генераторов
- Размеры
- лёгкая модель (размер в карточке не указан)
- Железо
- от: Ноутбук
Поиск по сканам документов2024
TIGER-Lab · Канада
Превращает модель «картинка плюс текст» в модель эмбеддингов: один вектор для страницы, схемы или фото с подписью. В карточке заявлен английский язык.
- Поиск по смешанному архиву текстов и картинок
- Поиск по страницам документов как по изображениям
- Подбор похожих карточек и иллюстраций
- Размеры
- около 4B (на базе Phi-3.5-V)
- Железо
- от: 1 видеокарта
Обработка фото2024
Jasper AI · США
Дополнение к FLUX для увеличения маленьких и размытых картинок с дорисовкой деталей. Популярно, но под некоммерческой лицензией FLUX dev.
- Увеличение мелких картинок с дорисовкой
- Улучшение сгенерированных изображений
- Пилоты апскейла для каталога
- Размеры
- дополнение к FLUX.1 dev 12B
- Железо
- от: 1 видеокарта
Картинка + текстНе развивается2023–2024
Hugging Face · Франция / США
Открытые модели зрения от Hugging Face, воспроизводившие закрытую Flamingo. Idefics3 стала основой для компактной линейки SmolVLM.
- Ответы на вопросы по картинкам
- Разбор документов и скриншотов
- Основа для дообучения
- Размеры
- 8B – 80B
- Железо
- от: 1 видеокарта
КартинкиНе развивается2023–2024
Лвминь Чжан (Стэнфорд) и сообщество · США
Надстройка над моделями картинок: задаёт позу, контуры, глубину или планировку, чтобы результат точно повторял нужную композицию.
- Картинка по эскизу или контуру
- Сохранение позы и композиции
- Визуализация интерьеров по планировке
- Размеры
- 0.4B – 1.3B
- Железо
- от: Ноутбук
ВидеоНе развивается2023–2024
Shanghai AI Lab и CUHK · Китай
Модуль, который оживляет модели картинок Stable Diffusion и превращает их в короткую анимацию. Одна из первых открытых видеотехнологий.
- Короткие анимации в фирменном стиле
- Живые обложки и баннеры
- Анимированные стикеры
- Размеры
- модуль движения поверх SD 1.5 / SDXL
- Железо
- от: Ноутбук
АватарыНе развивается2024
Kuaishou (Kling) · Китай
Оживляет портрет по видео-образцу: мимика и повороты головы переносятся с актёра на фото. Быстро работает даже на слабой видеокарте.
- Оживление портретов
- Перенос мимики актёра на персонажа
- Анимация маскотов
- Размеры
- меньше 1B
- Железо
- от: Ноутбук
Картинка + текстНе развивается2024
Microsoft · США
Очень маленькая модель зрения: подписи, поиск объектов, сегментация и чтение текста по одной команде. Работает даже на процессоре.
- Чтение текста на фото
- Поиск и выделение объектов
- Автоматические подписи к фото
- Размеры
- 0.23B – 0.77B
- Железо
- от: Ноутбук
Обработка фотоНе развивается2023–2024
Shanghai AI Laboratory (OpenMMLab) и Университет Цинхуа · Китай
Универсальная дорисовка фото: убрать объект, вставить новый по описанию, заменить форму или расширить кадр за края.
- Удаление и замена объектов на фото
- Расширение кадра под нужный формат
- Вставка товара или детали по текстовому описанию
- Размеры
- на базе SD 1.5
- Железо
- от: Ноутбук
Обработка фотоНе развивается2024
Лвмин Чжан (автор ControlNet) · США
Меняет освещение на фото: ставит объект или человека в новый свет по описанию или под заданный фон, чтобы вырезка смотрелась естественно.
- Подгонка света товара под новый фон
- Студийный свет для портретов без пересъёмки
- Единый стиль освещения в каталоге
- Размеры
- на базе SD 1.5
- Железо
- от: Ноутбук
Детекция подделокНе развивается2024
UC Santa Barbara и соавторы · США
Детектор ИИ-текста на Longformer: держит длинный документ целиком и обучен на текстах от множества разных языковых моделей. Ошибается в обе стороны, его вывод — повод для проверки человеком.
- Проверка длинных статей и отчётов целиком
- Отсев машинного текста в потоке публикаций
- Сравнение детекторов на своих данных
- Размеры
- около 150M (Longformer-base)
- Железо
- от: Ноутбук
КартинкиНе развивается2023–2024
Huawei Noah's Ark Lab и партнёры · Китай
Компактная модель картинок на 0.6B с качеством уровня крупных. Умеет 4K в версии Sigma, подходит для скромного железа.
- Иллюстрации для статей и соцсетей
- Фоны для карточек товаров
- Быстрые черновики визуалов
- Размеры
- 0.6B
- Железо
- от: Ноутбук
3DНе развивается2024
Tencent ARC · Китай
Делает 3D-сетку по одной картинке примерно за 10 секунд: сначала рисует объект с нескольких ракурсов, потом собирает из них модель.
- 3D-модель объекта по фото
- Заготовки для игр и визуализаций
- Прототипы для 3D-печати
- Размеры
- н/д
- Железо
- от: 1 видеокарта
Голос: спикеры и звукНе развивается2024
MyShell и MIT · США
Мгновенное клонирование голоса по короткому образцу с управлением эмоцией и акцентом, V2 говорит на нескольких языках. Использовать только с согласия владельца голоса.
- Озвучка роликов голосом диктора компании
- Голосовой бот с узнаваемым голосом бренда
- Перенос тембра на готовый синтез речи
- Размеры
- менее 1B
- Железо
- от: Ноутбук
ЛицаНе развивается2023–2024
Tencent AI Lab (h94) · Китай
Один из первых адаптеров, которые переносят лицо с фото в сгенерированную картинку. Версии для SD 1.5 идут на слабых картах, но веса некоммерческие.
- Портреты по фото в разных стилях
- Серии картинок с одним персонажем
- Эксперименты с аватарами
- Размеры
- адаптеры к SD 1.5 и SDXL
- Железо
- от: Ноутбук
Синтез речиНе развивается2024
MyShell и MIT · США
Лёгкий многоязычный синтез речи, который успевает в реальном времени на обычном процессоре. Английский с акцентами, испанский, французский, китайский, японский и корейский; русского нет.
- Озвучка ответов ботов на иностранных языках
- Озвучка обучающих материалов
- Чтение текстов вслух на сервере без видеокарты
- Размеры
- небольшая, работает в реальном времени на процессоре
- Железо
- от: Ноутбук
КартинкиНе развивается2023–2024
Playground AI · США
Модель на архитектуре SDXL с упором на эстетику: яркие цвета, контраст, портреты. Совместима с инструментами экосистемы SDXL.
- Эстетичные рекламные визуалы
- Портреты и лайфстайл-картинки
- Обложки для постов
- Размеры
- около 2.6B
- Железо
- от: 1 видеокарта
Обработка фотоНе развивается2024
XPixel Group (Шэньчжэньский институт передовых технологий АН Китая, Shanghai AI Lab и др.) · Китай
Мощное восстановление сильно испорченных фото на базе SDXL: дорисовывает детали, а не просто увеличивает. Требовательна к железу, лицензия некоммерческая.
- Восстановление старых и размытых фото
- Увеличение снимков с дорисовкой деталей
- Пилоты реставрации архивов
- Размеры
- на базе SDXL, плюс LLaVA 13B для описаний
- Железо
- от: 1 видеокарта
ЛицаНе развивается2024
InstantX (Xiaohongshu) · Китай
Генерирует картинки с лицом конкретного человека по одному фото, без дообучения. Популярен в ComfyUI, но веса только для исследований.
- Портреты в разных стилях по одному фото
- Эскизы аватаров и персонажей
- Прототипы фотосессий
- Размеры
- адаптер к SDXL
- Железо
- от: 1 видеокарта
Обработка фотоНе развивается2023
Alibaba DAMO Academy · Китай
Окрашивание чёрно-белых фото в естественные цвета. Лёгкая модель с коммерческой лицензией, есть компактная версия tiny.
- Окрашивание архивных фото
- Цветные версии исторических снимков для публикаций
- Сервис оживления семейных фото
- Размеры
- DDColor-T (tiny) и DDColor-L
- Железо
- от: Ноутбук
Голос: спикеры и звукНе развивается2023
Resemble AI · США
Модель улучшения речи: убирает шум и дорисовывает потерянные частоты, так что глухая запись звучит как студийная. Хороша для подготовки голоса к озвучке.
- Реставрация старых и телефонных записей
- Очистка голоса перед озвучкой и клонированием
- Улучшение звука в роликах и подкастах
- Размеры
- менее 1B
- Железо
- от: Ноутбук
Детекция подделокНе развивается2023
Hello-SimpleAI · Китай
Один из первых открытых классификаторов ИИ-текста, обучен на корпусе HC3 из пар ответов человека и ЧатГПТ. Ошибается в обе стороны: его вывод — повод поговорить с автором, а не доказательство.
- Предварительная проверка учебных работ
- Отсев шаблонных откликов и отзывов
- Разметка подозрительных текстов для ручной проверки
- Размеры
- около 125M (RoBERTa-base)
- Железо
- от: Ноутбук
Синтез речиНе развивается2023
Колумбийский университет · США
Лёгкая модель синтеза английской речи с естественной интонацией. На её основе построены многие другие модели, например Kokoro.
- Озвучка текстов на английском
- Основа для дообучения своего голоса
- Прототипы голосовых сервисов
- Размеры
- около 150M
- Железо
- от: Ноутбук
ПереводRUGGUFНе развивается2023
Google · США
Переводчик Google более чем на 400 языков под свободной лицензией. Русский есть. Хорошая замена NLLB, когда нужна коммерция.
- Перевод документов и писем
- Перевод каталогов и описаний товаров
- Перевод на языки стран СНГ и Азии
- Размеры
- 3B – 10B
- Железо
- от: Ноутбук
Синтез речиRUНе развивается2023
Coqui · Германия
Популярная модель клонирования голоса по короткому образцу на 17 языках, включая русский. Компания Coqui закрылась, развитие остановлено.
- Клонирование голоса по образцу
- Озвучка на нескольких языках
- Исследования и прототипы
- Размеры
- около 470M
- Железо
- от: Ноутбук
Музыка и звукНе развивается2023
LAION · Германия
Аналог CLIP для звука: переводит аудио и текст в общее пространство. Можно искать звуки и музыку по описанию и классифицировать их без обучения. Текст — английский.
- Поиск звуков и музыки по описанию
- Автоматические теги для аудиотеки
- Распознавание типа звука (сирена, стекло, голос)
- Размеры
- размер на карточке не указан
- Железо
- от: Ноутбук
Обработка фотоНе развивается2022–2023
Ким Тэхун (POSTECH) · Южная Корея
Модель выделения главного объекта и готовая программа transparent-background на её основе: убирает фон с фото, видео и веб-камеры одной командой.
- Пакетное удаление фона с фото
- Замена фона на цвет или размытие
- Удаление фона на видео
- Размеры
- небольшая (на базе Swin-B)
- Железо
- от: Ноутбук
Обработка фотоНе развивается2022–2023
XPixel Group (Шэньчжэньский институт передовых технологий АН Китая и др.) · Китай
Увеличение фото на трансформере, точнее SwinIR на тонких деталях. Есть версии для реальных снимков с шумом и лёгкая HAT-S.
- Увеличение фото товаров и интерьеров
- Подготовка изображений к печати
- Повышение чёткости архивных снимков
- Размеры
- 9M – 40M
- Железо
- от: Ноутбук
Голос: спикеры и звукНе развивается2022–2023
Хендрик Шретер (Университет Эрлангена) · Германия
Лёгкое шумоподавление речи в реальном времени: работает даже на обычном процессоре и на слабых устройствах. Убирает гул, улицу, шум офиса, оставляя голос.
- Очистка звонков и голосовых сообщений от шума
- Подготовка записей перед распознаванием речи
- Шумодав для видеосвязи
- Размеры
- около 2M
- Железо
- от: Ноутбук
ТекстRUGGUFНе развивается2023
Сбер (ai-forever) · Россия
Базовая русскоязычная модель Сбера на 13 млрд параметров, из дообученной версии которой вырос GigaChat. Продолжает тексты на русском и английском, контекст всего 2048 токенов; сегодня интересна как основа для узкого дообучения.
- Основа для дообучения под узкую русскую задачу
- Генерация шаблонных русских текстов
- Эксперименты с русскоязычными моделями без ограничений лицензии
- Размеры
- 13B
- Железо
- от: 1 видеокарта
Синтез речиRUGGUFНе развивается2023
Suno · США
Одна из первых открытых моделей, которая озвучивает текст с интонациями, смехом и паузами. Поддерживает около десятка языков, включая русский. Сейчас устарела.
- Черновая озвучка роликов
- Прототипы голосовых сервисов
- Звуковые эффекты в речи
- Размеры
- около 300M – 1B
- Железо
- от: Ноутбук
3DНе развивается2022–2023
OpenAI · США
Ранние открытые модели OpenAI, которые делают 3D-объект по тексту или картинке за секунды. Качество простое, зато быстро и легко запускается.
- Черновые 3D-макеты по описанию
- Быстрые прототипы объектов для игр и AR
- Учебные и исследовательские пилоты по 3D
- Размеры
- 40M – 1B
- Железо
- от: Ноутбук
Обработка фотоНе развивается2023
S-Lab, Наньянский технологический университет · Сингапур
Одна из первых моделей увеличения фото на базе Stable Diffusion: восстанавливает реалистичные детали. Лицензия некоммерческая.
- Увеличение фото с дорисовкой деталей
- Исследовательские пилоты реставрации
- Сравнение с классическими апскейлерами
- Размеры
- на базе SD 2.1
- Железо
- от: 1 видеокарта
Обработка фотоНе развивается2022–2023
S-Lab, Наньянский технологический университет · Сингапур
Популярная реставрация лиц на старых и размытых фото, работает и с видео. Есть режимы дорисовки и окрашивания лица. Лицензия некоммерческая.
- Восстановление лиц на старых фото
- Улучшение лиц на видео низкого качества
- Пилоты реставрации семейных архивов
- Размеры
- небольшая, до 0.1B
- Железо
- от: Ноутбук
Музыка и звукНе развивается2022
MIT · США
Классическая модель 2021 года для распознавания звуков: определяет 527 классов событий AudioSet (сирена, лай, стекло, музыка). Лёгкая, работает без видеокарты, с 2022 года в Transformers.
- Распознавание звуковых событий
- Разметка аудиоархива
- Детекция тревожных звуков
- Размеры
- около 87M
- Железо
- от: Ноутбук
Обработка фотоGGUFНе развивается2021–2022
Tencent ARC Lab · Китай
Классика увеличения фото в 2–4 раза с очисткой от шума и артефактов сжатия. Лёгкая, работает даже на процессоре. Есть версии для рисунков и аниме.
- Увеличение старых и мелких фото товаров
- Очистка картинок от артефактов сжатия
- Подготовка изображений к печати
- Размеры
- около 17M
- Железо
- от: Ноутбук
Компьютерное зрениеНе развивается2021–2022
OpenAI · США
Модель 2021 года, которая первой связала картинки и текст: поиск фото по словам и классификация без обучения. Понимает только английский, сейчас чаще берут SigLIP 2 или PE.
- Поиск картинок по текстовому запросу
- Автоматические теги для каталога
- Поиск похожих изображений
- Размеры
- около 0.15B – 0.6B
- Железо
- от: Ноутбук
Обработка фотоНе развивается2021–2022
Tencent ARC Lab · Китай
Проверенная реставрация лиц на старых и сжатых фото с коммерческой лицензией. Часто работает в паре с Real-ESRGAN, самые ходовые версии 1.3 и 1.4.
- Восстановление лиц на старых фото
- Улучшение аватаров и фото профиля
- Реставрация в фотосалоне или онлайн-сервисе
- Размеры
- небольшая, до 0.1B
- Железо
- от: Ноутбук
Компьютерное зрениеRUНе развивается2022
Сбер AI и SberDevices (ai-forever) · Россия
Русская версия CLIP: сопоставляет картинки и подписи на русском. Позволяет искать фото по описанию и раскладывать изображения по категориям без обучения.
- Поиск товаров по фото и по русскому описанию
- Сортировка картинок по категориям без разметки
- Проверка соответствия фото и подписи
- Размеры
- 150M – 430M
- Железо
- от: Ноутбук
Обработка фотоGGUFНе развивается2021
Samsung AI Center Москва (вместе со Сколтехом) · Россия
Удаление лишних объектов, надписей и водяных знаков с фото с аккуратной дорисовкой фона. Лёгкая и быстрая, до сих пор стандарт для такой задачи.
- Удаление ценников, людей и мусора с фото
- Чистка фото интерьеров и недвижимости
- Удаление надписей и дат с архивных снимков
- Размеры
- около 51M
- Железо
- от: Ноутбук
Обработка фотоНе развивается2021
ETH Zurich · Швейцария
Модель на трансформере для увеличения, шумоподавления и очистки фото от артефактов JPEG. Лёгкая и проверенная, часто стоит внутри других систем.
- Увеличение фото
- Шумоподавление снимков
- Очистка от артефактов сжатия
- Размеры
- около 12M
- Железо
- от: Ноутбук
АватарыНе развивается2020
IIIT Hyderabad · Индия
Классическая модель синхронизации губ с аудио, до сих пор популярна в любительских сборках. Губы точные, но картинка лица размытая, лицензия некоммерческая.
- Быстрые пробы переозвучки
- Сравнение с новыми lip-sync моделями
- Учебные и исследовательские проекты
- Размеры
- малая модель, лицо 96 пикселей
- Железо
- от: Ноутбук