Что запустить на одной видеокарте

Одна видеокарта — самый частый вариант для бизнеса: сервер с картой на 16, 24, 48 или 80 ГБ видеопамяти закрывает почти всё, кроме самых больших моделей. Здесь уже работает живой чат, генерация картинок и разбор документов в реальном времени.

Что это на практике

Карта на 16 ГБЯзыковые модели среднего размера в сжатом виде, распознавание документов, генерация картинок. Самый доступный порог входа.
Карта на 24 ГБРабочая лошадка: модель побольше или несколько задач на одной карте. Хватает и на чат-бота, и на фоновую обработку.
Карта на 48–80 ГБМодели в несжатом виде, длинный контекст, генерация видео. Дороже, но одна такая карта заменяет связку из нескольких.

Что на этом работает

Видео 16

ВидеоGGUF2025–2026

MAGI

Sand AI · Китай

Видео, которое генерируется по кускам друг за другом, поэтому ролик можно продлевать бесконечно. MAGI-2 делает видео сразу со звуком.

  • Длинные ролики с продолжением
  • Видео со звуком
  • Оживление изображений
Размеры
4.5B – 114B-A6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Видео2025–2026

SANA-Video

NVIDIA · США

Лёгкая и быстрая видеомодель NVIDIA. Выдаёт 720p-ролики на одной видеокарте, есть версия на 4 шага для быстрой генерации.

  • Быстрые ролики для соцсетей
  • Массовая генерация видео
  • Видео из картинки
Размеры
2B – 5B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Видео2025–2026

Wan

Alibaba · Китай

Генерация видео по тексту и по картинке. Младшая версия запускается на игровой видеокарте. После 2.2 базовые модели открыто не выходят, только прикладные: монтаж (VACE), говорящие персонажи по звуку (S2V), танцы под музыку (Dancer).

  • Короткие рекламные ролики
  • Оживление фото товара
  • Видео для соцсетей
Размеры
1,3B – 14B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Видео2024–2026

LTX-Video / LTX-2

Lightricks · Израиль

Быстрая видеомодель, которая с LTX-2 генерирует видео сразу со звуком и речью. Можно управлять камерой и позой, есть облегчённые версии.

  • Рекламные ролики со звуком
  • Видео из фото товара
  • Озвученные сцены для соцсетей
Размеры
2B – 22B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
ВидеоGGUF2025–2026

SCAIL

Zhipu AI (Z.ai) и Университет Цинхуа · Китай

Анимирует персонажа с картинки по движениям из другого видео, в том числе сложные развороты и несколько персонажей. SCAIL-2 работает без промежуточного скелета и умеет заменять персонажа в ролике.

  • Перенос движений актёра на персонажа
  • Замена персонажа в готовом видео
  • Анимация маскотов и иллюстраций
Размеры
14B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Видео2025–2026

Matrix-Game

Skywork AI (Kunlun) · Китай

Интерактивная «модель мира»: генерирует видео игрового мира в реальном времени и реагирует на нажатия клавиш и мышь. Версия 3.0 держит память о сцене минутами.

  • Прототипы игровых миров без движка
  • Интерактивные демо и симуляции
  • Генерация данных для обучения агентов
Размеры
1.8B – 17B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
ВидеоGGUF2025–2026

SkyReels

Skywork AI (Kunlun Tech) · Китай

Видеомодели для кинематографичных сцен с людьми. Умеют ролики неограниченной длины, продление видео и говорящих персонажей по аудио.

  • Длинные ролики с продолжением
  • Видео с одним персонажем по референсу
  • Говорящий аватар по голосу
Размеры
1.3B – 19B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
ВидеоGGUF2026

MOVA

OpenMOSS / MOSI · Китай

Генерирует видео сразу со звуком: речь с синхронными губами, эффекты и окружение в одном проходе. MoE-архитектура на 32B параметров, есть версии 360p и 720p.

  • Короткие ролики с речью и звуком по описанию
  • Рекламные сцены с диалогами
  • Прототипы видео для сторибордов
Размеры
32B-A18B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
ВидеоGGUF2024–2025

HunyuanVideo

Tencent · Китай

Видеомодель Tencent, одна из первых открытых на уровне закрытых сервисов. Версия 1.5 стала легче (8.3B) и идёт на потребительских картах.

  • Видео по текстовому сценарию
  • Оживление изображений
  • База для дообучения своих видеомоделей
Размеры
8.3B – 13B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Видео2025

Ovi

Character.AI · США

Генерирует видео вместе со звуком и речью по тексту или картинке: две ветви (видео на базе Wan 2.2 и аудио 5B) работают синхронно. Нужно 24–32 ГБ видеопамяти.

  • Короткие ролики с говорящими персонажами
  • Оживление картинки с озвучкой
  • Прототипы рекламных сцен
Размеры
11B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
ВидеоGGUF2025

LongCat-Video

Meituan · Китай

Видеомодель на 13.6B: из текста, из картинки и продолжение видео. Держит качество на роликах в несколько минут.

  • Длинные ролики
  • Видео из фото
  • Продолжение готового видео
Размеры
13.6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Видео2025

Hunyuan-GameCraft

Tencent Hunyuan · Китай

Делает из одной картинки управляемое видео игровой сцены: камера движется по командам клавиатуры. Минимум 24 ГБ видеопамяти, рекомендовано 80 ГБ.

  • Интерактивные видео-прототипы игровых локаций
  • Ролики с проходом камеры по сцене
  • Демо уровней для питчей
Размеры
на базе HunyuanVideo
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее

Картинки 15

КартинкиGGUF2025–2026

Qwen-Image

Alibaba · Китай

Генерация и редактирование картинок, в том числе с текстом на изображении. Ранние версии можно в коммерцию, свежая 2.1 — только некоммерческая.

  • Инфографика для карточек товаров
  • Правка фото по текстовой команде
  • Рекламные креативы
Размеры
7B – 20B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
КартинкиRU2022–2026

Kandinsky

Сбер (Kandinsky Lab) · Россия

Российское семейство генерации картинок и видео от Сбера. Хорошо понимает запросы на русском и российский культурный контекст, открыто под MIT.

  • Картинки по описанию на русском
  • Короткие рекламные ролики из текста или фото
  • Редактирование изображений по инструкции
Размеры
2B – 19B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
КартинкиGGUF2025–2026

Chroma

lodestones (независимый разработчик) · нет данных

Общественная модель, переобученная из FLUX.1-schnell с упрощённой архитектурой. Без цензуры стилей, популярна как база для дообучения.

  • База для дообучения своих стилей
  • Художественные иллюстрации
  • Картинки для игр
Размеры
4B – 8.9B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
КартинкиGGUF2026

Krea 2

Krea · США

Модель картинок на 12B с упором на реализм без глянцевого «ИИ-вида». Turbo-версия выдаёт 2K-картинку за пару секунд.

  • Реалистичные фото для рекламы
  • Картинки высокого разрешения
  • Дообучение стилей
Размеры
12B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
КартинкиGGUF2026

Ideogram 4

Ideogram · Канада

Открытые веса модели Ideogram, известной точной типографикой. Под некоммерческой лицензией: для бизнеса подходит только для тестов.

  • Тестирование генерации с текстом
  • Исследования и прототипы
Размеры
около 9B
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
КартинкиGGUF2025–2026

HiDream

HiDream.ai · Китай

Открытые модели картинок под MIT: генерация (I1), редактирование по инструкции (E1) и единая модель O1-Image, которая делает и то и другое.

  • Генерация картинок по описанию
  • Правка изображений словами
  • Вариации продуктовых фото
Размеры
около 9B – 17B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
КартинкиGGUF2025–2026

LongCat-Image

Meituan · Китай

Модель генерации и редактирования картинок на 6B от Meituan. Хорошо пишет китайский текст, есть быстрая версия для правок.

  • Генерация картинок по описанию
  • Правка фото по инструкции
  • Визуалы для карточек товаров
Размеры
6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
КартинкиGGUF2024–2026

FLUX

Black Forest Labs · Германия

Генерация картинок от авторов Stable Diffusion. Хорошо рисует текст на изображении и держит композицию.

  • Картинки для карточек товаров
  • Баннеры и обложки
  • Редактирование фото по описанию (Kontext)
Размеры
4B – 32B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
КартинкиGGUF2024–2026

Hunyuan Image

Tencent · Китай

Модели картинок Tencent. HunyuanImage 3.0 — крупнейшая открытая MoE-модель генерации на 80B, умеет рассуждать над запросом и редактировать по инструкции.

  • Сложные сцены по длинному описанию
  • Картинки с текстом на китайском и английском
  • Редактирование изображений по инструкции
Размеры
1.5B – 80B-A13B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
КартинкиGGUF2025–2026

Z-Image

Alibaba (Tongyi-MAI) · Китай

Компактная модель на 6B с фотореализмом уровня крупных моделей. Turbo-версия выдаёт картинку за несколько шагов на обычной игровой видеокарте.

  • Фотореалистичные рекламные картинки
  • Картинки с текстом на английском и китайском
  • Массовая генерация визуалов
Размеры
6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Картинки2026

GLM-Image

Zhipu AI (Z.ai) · Китай

Гибрид языковой модели на 9B и декодера на 7B. Сильна в картинках с большим количеством текста: постеры, инфографика, слайды.

  • Постеры и баннеры с текстом
  • Инфографика
  • Иллюстрации к презентациям
Размеры
9B + 7B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
КартинкиGGUF2024–2025

OmniGen

BAAI (Пекинская академия ИИ) · Китай

Универсальная модель: генерирует, редактирует, переносит объект или человека с фото в новую сцену без отдельных плагинов.

  • Перенос товара или человека в новую сцену
  • Редактирование фото по инструкции
  • Генерация по нескольким референсам
Размеры
около 4B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее

Текст 10

ТекстGGUF2025–2026

LLaDA

Жэньминьский университет (GSAI) и Ant Group (inclusionAI) · Китай

Диффузионные языковые модели: текст пишется не по одному слову, а сразу блоками с последующим уточнением, что ускоряет генерацию. LLaDA2.2 умеет править уже написанное и рассчитана на агентов. Генератор картинок LLaDA-Image — отдельный продукт.

  • Быстрая генерация кода и текстов
  • Агентные сценарии с длинным контекстом
  • Исследования альтернатив обычным LLM
Размеры
8B – 100B (MoE)
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
ТекстOllama2026

Muse Glimmer

Meta Superintelligence Labs · США

Открытая модель Meta для агентов на доступном железе: дистиллирована из закрытой Muse Spark, понимает текст и картинки, обучена на 100+ языках.

  • Агенты с вызовом инструментов
  • Разбор скриншотов, графиков и документов
  • Многоязычный ассистент
Размеры
30B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
ТекстGGUF2025–2026

Kimi

Moonshot AI · Китай

Сверхкрупные MoE-модели Moonshot для агентной работы. K3 на 2,8 трлн параметров — самая большая открытая модель на момент выхода, с контекстом до 1 млн токенов и пониманием картинок; K2.7-Code заточена под программирование.

  • Многошаговые агенты: поиск, сбор данных, отчёты
  • Глубокий анализ документов
  • Помощь программистам
Размеры
16B-A3B – 2.8T-A104B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
ТекстOllama2023–2026

Solar

Upstage · Южная Корея

Модели корейской Upstage. Solar Open 2 рассчитана на офисную работу с документами: 250 млрд параметров, из них активны 15 млрд, языки — английский, корейский, японский.

  • Работа с офисными документами
  • Агенты для рутинных задач
  • Помощь программистам
Размеры
10.7B – 250B-A15B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
ТекстGGUF2025–2026

Step

StepFun · Китай

MoE-модели StepFun, рассчитанные на быструю и дешёвую работу: при 196 млрд параметров Step-3.5/3.7-Flash задействуют около 11 млрд на токен. Есть компактные Step3-VL-10B для картинок и голосовая Step-Audio 2 mini.

  • Агенты с высокой нагрузкой
  • Разбор документов со схемами и скриншотами
  • Помощь программистам
Размеры
8B – 321B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
ТекстGGUF2024–2026

INTELLECT

Prime Intellect · США

Модели, обученные распределённо на видеокартах со всего мира. INTELLECT-3 на 106B дообучена с подкреплением для математики, кода и агентов.

  • Задачи с рассуждением и математикой
  • Помощь в программировании
  • Агенты с вызовом инструментов
Размеры
10B – 106B-A12B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
ТекстOllama2025

gpt-oss

OpenAI · США

Первые открытые модели OpenAI со времён GPT-2. Рассуждения, вызов инструментов, младшая версия помещается на одну видеокарту.

  • ИИ-агент с вызовом внутренних систем
  • Ответы по регламентам
  • Черновики писем и отчётов
Размеры
20B, 120B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
ТекстGGUF2025

Seed-OSS

ByteDance · Китай

Открытая модель ByteDance на 36B с контекстом до 512 тыс. токенов и настраиваемым «бюджетом размышлений». Помещается на одну мощную видеокарту.

  • Разбор длинных документов
  • Агенты с инструментами
  • Корпоративный ассистент
Размеры
36B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
ТекстOllama2024

Athene

Nexusflow · США

Дообученные Llama 3 и Qwen 2.5 от Nexusflow. Athene-V2-Agent специально натренирован на вызов функций и агентные сценарии. Коммерческое использование запрещено.

  • Исследование агентов и вызова функций
  • Сравнение с коммерческими моделями
  • Эксперименты с чат-ассистентом
Размеры
70B – 72B
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
ТекстRUGGUFНе развивается2023

ruGPT-3.5

Сбер (ai-forever) · Россия

Базовая русскоязычная модель Сбера на 13 млрд параметров, из дообученной версии которой вырос GigaChat. Продолжает тексты на русском и английском, контекст всего 2048 токенов; сегодня интересна как основа для узкого дообучения.

  • Основа для дообучения под узкую русскую задачу
  • Генерация шаблонных русских текстов
  • Эксперименты с русскоязычными моделями без ограничений лицензии
Размеры
13B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее

3D 10

3D2025–2026

VGGT

Meta и Оксфордский университет (VGG) · США / Великобритания

Восстанавливает 3D-сцену по одной, нескольким или сотням фотографий за секунды: положение камер, глубину и облако точек. Лучшая статья CVPR 2025.

  • 3D-модель помещения или объекта по серии фото
  • Определение положения камер для фотограмметрии
  • Облако точек для обмеров и сравнения с планом
Размеры
около 1.2B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
3D2025–2026

HY-World (HunyuanWorld)

Tencent · Китай

Генерация целых 3D-миров и сцен по тексту или картинке, по которым можно ходить. Вторая версия собирает сцену из видео и фото.

  • 3D-сцены для игр и виртуальных туров
  • Фоны и окружение для видеопродакшна
  • Черновики локаций для симуляций
Размеры
набор из нескольких моделей
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
3DGGUF2024–2025

TRELLIS

Microsoft · США

Одна из сильнейших открытых 3D-моделей: по картинке или тексту выдаёт сетку с текстурой или гауссову сцену. TRELLIS.2 заметно детальнее первой версии.

  • 3D-модели товаров и интерьера по фото
  • Ассеты для игр и AR/VR
  • Прототипы для 3D-печати
Размеры
до 4B (TRELLIS.2)
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
3D2025

MapAnything

Meta и Университет Карнеги — Меллон · США

Одна модель собирает метрическую 3D-реконструкцию из фото, а если есть данные о камерах, глубине или позах — учитывает и их. Есть версия весов под Apache 2.0.

  • 3D-реконструкция объекта или помещения по фото
  • Экспорт сцены в формат COLMAP для дальнейшей обработки
  • Оценка глубины и положения камер
Размеры
около 1.2B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
3D2025

Pi3 (π³)

Shanghai AI Lab · Китай

Восстанавливает 3D-сцену и положения камер по набору фото или видео, не опираясь на «опорный» кадр. Pi3X даёт более гладкие облака точек и примерный масштаб в метрах.

  • 3D-реконструкция сцены по видео
  • Оценка положения камеры по кадрам
  • Облака точек для исследований и прототипов
Размеры
0.96B – 1.4B
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
3D2025

HY-Motion

Tencent Hunyuan · Китай

Генерирует 3D-анимацию движения человека по текстовому описанию: скелетная анимация сразу подходит для 3D-редакторов и игровых движков. Понимает английский и китайский.

  • Анимация персонажа по текстовому описанию
  • Черновая анимация для игр и роликов
  • Библиотека движений для аватаров
Размеры
0.46B – 1B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
3DGGUF2025

SAM 3D

Meta · США

Восстанавливает 3D-форму предмета или тела человека по одной обычной фотографии, даже если объект частично закрыт. Две модели: Objects и Body.

  • 3D-модель предмета с фото из каталога
  • Оценка позы и формы тела по фото
  • Примерка и AR-сценарии
Размеры
н/д
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
3D2024–2025

Hunyuan3D

Tencent · Китай

Открытая 3D-линейка Tencent: форма и текстура по картинке, качество на уровне платных сервисов. Omni добавляет управление позой и формой, Part делит модель на детали.

  • 3D-модели товаров с текстурой
  • Персонажи и предметы для игр
  • Разделение модели на детали для печати
Размеры
набор моделей: форма и текстуры
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
3D2024–2025

Stable Fast 3D / SPAR3D

Stability AI · Великобритания

Модели Stability AI, которые за секунду превращают одну фотографию в 3D-модель с текстурой. SPAR3D позволяет поправить форму через облако точек.

  • 3D-карточки товаров по фото
  • Ассеты для игр и AR
  • Быстрые макеты для дизайна
Размеры
1B – 2B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
3DНе развивается2024

InstantMesh

Tencent ARC · Китай

Делает 3D-сетку по одной картинке примерно за 10 секунд: сначала рисует объект с нескольких ракурсов, потом собирает из них модель.

  • 3D-модель объекта по фото
  • Заготовки для игр и визуализаций
  • Прототипы для 3D-печати
Размеры
н/д
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее

Примерка одежды 9

Примерка одежды2026

FASHN VTON

FASHN AI · Израиль

Редкая открытая примерка с коммерческой лицензией: без маски, берёт фото вещи на модели или раскладку. Веса около 2 ГБ.

  • Карточки товара на модели без фотосессии
  • Примерочная на сайте магазина
  • Каталог из фото раскладки одежды
Размеры
972M
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Примерка одежды2025

OmniTry

Kunbyte AI · Китай

Примерка не только одежды: очки, серьги, сумки, шляпы, часы и другие аксессуары. Работает без маски. Требует видеокарту от 28 ГБ.

  • Примерка аксессуаров и украшений на фото
  • Карточки товара с аксессуаром на модели
  • Примерочная очков и бижутерии на сайте
Размеры
дополнение к FLUX.1 Fill dev 12B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Примерка одежды2025

FastFit

LavieAI и Университет Сунь Ятсена · Китай

Примерка сразу нескольких вещей за раз: верх, низ, обувь, сумка. Быстрее прежних моделей за счёт кэширования. Лицензия некоммерческая.

  • Сборка образа из нескольких товаров на одной модели
  • Пилот «собери лук» на сайте
  • Прототипы лукбуков без съёмки
Размеры
на базе SD 1.5 inpainting
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Примерка одежды2025

Any2AnyTryon

Пекинский университет почты и связи и др. · Китай

Универсальный набор для одежды на базе FLUX: примерка, генерация модели в заданной вещи и «снятие» вещи с человека в отдельное фото товара.

  • Примерка по фото товара
  • Фото модели в вещи по текстовому описанию
  • Чистое фото вещи со снимка человека
Размеры
дополнения (LoRA) к FLUX.1 dev 12B
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Примерка одежды2024

Leffa

Meta AI (вместе с King's College London) · США

Модель Meta для примерки и смены позы человека на фото. Бережно переносит мелкие детали ткани и надписи. Лицензия MIT, но обучающие данные некоммерческие.

  • Примерка одежды на фото модели
  • Смена позы модели на уже снятом кадре
  • Добор ракурсов для карточки товара
Размеры
на базе Stable Diffusion
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Примерка одежды2024

FitDiT

Tencent и Фуданьский университет · Китай

Примерка на трансформере от Tencent: точнее передаёт фактуру ткани, мелкий принт и длину вещи. Лицензия некоммерческая.

  • Примерка вещей со сложным принтом и фактурой
  • Карточки товара на модели для тестов
  • Подбор длины и посадки на фото
Размеры
на базе SD3
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Примерка одеждыНе развивается2024

IDM-VTON

KAIST и OMNIOUS.AI · Южная Корея

Одна из самых известных открытых примерок: переносит вещь с фото товара на фото человека, хорошо держит принты и логотипы. Лицензия некоммерческая.

  • Пилот примерочной на сайте магазина
  • Прототип карточек товара на модели без фотосессии
  • Сравнение с коммерческими сервисами примерки
Размеры
на базе SDXL
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Примерка одеждыНе развивается2024

OOTDiffusion

Xiao-i Research · Китай

Ранняя популярная открытая примерка: одна версия для верхней одежды по пояс, другая для образа в полный рост. Лицензия некоммерческая.

  • Примерка верха на фото модели
  • Примерка в полный рост: верх, низ, платья
  • Прототип примерочной для тестов
Размеры
на базе Stable Diffusion
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Примерка одеждыНе развивается2024

StableVITON

KAIST · Южная Корея

Исследовательская модель примерки с конференции CVPR 2024, одна из первых на базе Stable Diffusion. Сейчас чаще служит точкой сравнения.

  • Пилот примерки верхней одежды
  • Сравнение качества разных моделей примерки
  • Обучение своей примерки на базе открытого кода
Размеры
на базе Stable Diffusion
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее

Роботы 8

Роботы2025–2026

GigaBrain

GigaAI · Китай

Модель управления роботами, обученная в основном на синтетических данных из модели мира. Позволяет меньше тратить на сбор данных с реальных роботов.

  • Управление манипулятором
  • Дообучение на малом объёме своих данных
  • Пилоты сортировки и сборки
Размеры
3.5B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Роботы2025–2026

NVIDIA Cosmos

NVIDIA · США

Модели «мира» для роботов и беспилотников: генерируют реалистичное видео физических сцен и предсказывают действия. Cosmos 3 объединяет понимание, генерацию и управление.

  • Синтетические видео для обучения роботов и беспилотников
  • Проверка сценариев в симуляции
  • Управление роботом (Policy-версии)
Размеры
2B – 65B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Роботы2026

LingBot-VLA

Ant Group (Robbyant) · Китай

Модель управления роботами от Ant Group, обученная на большом объёме данных с реальных роботов. Версия 2.0 работает с разными типами манипуляторов.

  • Управление двуруким манипулятором
  • Дообучение под свою операцию
  • Пилоты сборки и сортировки
Размеры
4B – 6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Роботы2026

Xiaomi Robotics

Xiaomi · Китай

Открытые модели управления роботами от Xiaomi. Robotics-1 рассчитана на бытовые и кухонные задачи, U0 объединяет понимание сцены и действия.

  • Управление манипулятором по команде
  • Бытовые и сервисные сценарии
  • Основа для дообучения
Размеры
4B – 5B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Роботы2025–2026

MolmoAct

Ai2 (Allen Institute for AI) · США

Полностью открытая модель управления роботом, которая сначала «рассуждает» о пространстве и траектории, а потом действует. Ход рассуждений можно проверить.

  • Управление манипулятором с объяснимыми шагами
  • Дообучение под свой робот
  • Исследовательские пилоты
Размеры
5B – 8B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Роботы2025–2026

NVIDIA Isaac GR00T

NVIDIA · США

Базовая модель NVIDIA для человекоподобных роботов и манипуляторов: видит, понимает команду и выдаёт движения. Встроена в экосистему Isaac.

  • Управление человекоподобными роботами
  • Дообучение под свою роботизированную ячейку
  • Обучение в симуляции с переносом на реального робота
Размеры
2B – 3B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Роботы2025

π0 / π0.5 (openpi)

Physical Intelligence · США

Модели управления роботами от Physical Intelligence: складывание белья, уборка, работа с предметами. π0.5 лучше справляется в незнакомой обстановке.

  • Управление манипуляторами и двуруким роботом
  • Дообучение под свои операции
  • Пилоты по автоматизации ручного труда
Размеры
около 3B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Роботы2024–2025

OpenVLA

Стэнфорд, Беркли и партнёры · США

Первая крупная открытая модель «зрение-язык-действие»: робот-манипулятор выполняет команды вроде «положи яблоко в миску». OFT ускоряет её в разы.

  • Управление манипулятором по текстовой команде
  • Пилоты по роботизации простых операций
  • Основа для дообучения под свой робот
Размеры
7B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее

Аватары 7

АватарыGGUF2025–2026

LongCat-Video-Avatar

Meituan · Китай

Говорящие люди по аудио на базе LongCat-Video. Версия 1.5 доведена до продакшна: стабильные длинные ролики на китайском и английском.

  • Видео с ведущим новостей или курса
  • Промо-ролики с говорящим персонажем
  • Пение и озвучка
Размеры
на базе LongCat-Video 13.6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Аватары2024–2026

Hallo

Фуданьский университет · Китай

Серия говорящих портретов по аудио: от коротких клипов до часовых видео в 4K. Hallo-Live рассчитана на работу в реальном времени.

  • Видео с ведущим по фото и аудио
  • Длинные обучающие ролики
  • Живой аватар
Размеры
около 1B – 5B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Аватары2026

daVinci-MagiHuman

SII-GAIR и Sand.ai · Китай

Генерирует видео с говорящим человеком сразу со звуком: один трансформер обрабатывает текст, видео и аудио. Речь на 7 языках, русского в списке нет. Есть дистиллированные быстрые версии.

  • Видео с ведущим по сценарию
  • Рекламные ролики с говорящим персонажем
  • Обучающие видео с диктором
Размеры
15B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Аватары2024–2026

EchoMimic

Ant Group · Китай

Говорящие аватары от Ant Group: лицо, а с V2 и жесты рук. V3-Flash выдаёт видео за 8 шагов и укладывается в 12 ГБ видеопамяти.

  • Видео с ведущим по фото и голосу
  • Аватар с жестами для презентаций
  • Озвученные персонажи
Размеры
до 1.3B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
АватарыGGUF2025–2026

Live Avatar

Alibaba (Quark) · Китай

Потоковый аватар в реальном времени неограниченной длины. Подходит для живых эфиров и диалога, но требует мощного серверного железа.

  • Живой аватар для диалога с клиентом
  • Бесконечные трансляции с ведущим
  • Интерактивные персонажи
Размеры
14B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Аватары2025

MultiTalk / InfiniteTalk

Meituan · Китай

Дубляж и говорящие персонажи на базе Wan: MultiTalk ведёт диалог нескольких людей, InfiniteTalk переозвучивает видео любой длины с мимикой и телом.

  • Дубляж видео с подгонкой мимики
  • Диалог двух персонажей по аудио
  • Длинные ролики с ведущим
Размеры
14B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
АватарыGGUF2025

HunyuanVideo-Avatar

Tencent · Китай

Говорящие персонажи на базе HunyuanVideo: передаёт эмоции голоса, работает с несколькими персонажами и разными стилями.

  • Видео с ведущим по фото и аудио
  • Сцены с несколькими говорящими
  • Мультяшные персонажи
Размеры
около 13B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее

Поиск по сканам документов 7

Поиск по сканам документовGGUF2026

EVIE

Tencent · Китай

Модели Tencent на базе Qwen3.5 для поиска по сканам и PDF как по картинкам. По данным карточки, на момент выхода — среди лучших в рейтинге ViDoRe.

  • Поиск по сканам и PDF без распознавания
  • RAG по отчётам с таблицами и графиками
  • Поиск по архивам документов
Размеры
4.5B – 8B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Поиск по сканам документов2025

Nomic Embed Multimodal / ColNomic

Nomic AI · США

Поиск по страницам PDF и сканам как по картинкам. В карточках заявлены английский, итальянский, французский, немецкий и испанский — русского в списке нет.

  • Поиск по архиву сканов и PDF
  • Поиск по таблицам и схемам внутри документов
  • Подбор страниц для ответа ИИ-помощника
Размеры
3B и 7B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Поиск по сканам документов2025

LlamaIndex vdr

LlamaIndex · США

Небольшая модель для поиска по страницам-картинкам от команды популярного фреймворка RAG. Языки в карточке: английский, итальянский, французский, немецкий, испанский.

  • Поиск по сканам и PDF без распознавания текста
  • Поиск по счетам, актам и договорам
  • Подбор страниц для ответа ИИ-помощника
Размеры
2B (на базе Qwen2-VL)
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Поиск по сканам документов2024

GME (General Multimodal Embedding)

Alibaba (Tongyi Lab) · Китай

Один вектор и для текста, и для картинки, и для их пары: одной моделью можно искать товар по фото, страницу документа по вопросу и картинку по описанию. Языки в карточке: английский и китайский.

  • Поиск товара по фотографии
  • Поиск по каталогу картинок и карточек
  • Поиск по страницам документов как по изображениям
Размеры
2B и 7B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Поиск по сканам документов2024

VLM2Vec

TIGER-Lab · Канада

Превращает модель «картинка плюс текст» в модель эмбеддингов: один вектор для страницы, схемы или фото с подписью. В карточке заявлен английский язык.

  • Поиск по смешанному архиву текстов и картинок
  • Поиск по страницам документов как по изображениям
  • Подбор похожих карточек и иллюстраций
Размеры
около 4B (на базе Phi-3.5-V)
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Поиск по сканам документов2024

MonoQwen2-VL (LightOn)

LightOn · Франция

Реранкер для страниц-картинок: после визуального поиска переставляет найденные страницы по тому, насколько они отвечают на вопрос. Языки в карточке не указаны.

  • Уточнение выдачи поиска по сканам и PDF
  • Отбор страниц перед ответом ИИ-помощника
  • Сортировка найденных слайдов и отчётов
Размеры
2B (на базе Qwen2-VL)
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Поиск по сканам документов2024

DSE (Document Screenshot Embedding)

Университет Ватерлоо, проект Tevatron · Канада

Ищет по скриншотам страниц: страницу не распознают, а превращают целиком в один вектор — индекс компактнее, чем у моделей с поздним взаимодействием. Языки в карточке: английский и французский.

  • Поиск по сканам и PDF без распознавания текста
  • Поиск по презентациям и отчётам со сложной вёрсткой
  • Подбор страниц для ответа ИИ-помощника
Размеры
2B (на базе Qwen2-VL)
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее

Картинка + текст 5

Картинка + текст2026

MOSS-VL

OpenMOSS (Фуданьский университет) · Китай

Модель «картинка + видео + текст» с упором на длинные видео и точную привязку событий к секундам. Есть версия Realtime для потокового видео в реальном времени.

  • Разбор длинных видео и поиск событий по времени
  • Потоковый анализ видео в реальном времени
  • Понимание фото и документов
Размеры
около 11B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Картинка + текст2026

Qwen3-VL Resume Parser

Sukhrob Nurali · не раскрыта

Дообученная Qwen3-VL-8B читает страницы резюме как картинки и возвращает запись из 23 полей в JSON. Автор прямо пишет: для автоматических решений по кандидатам модель не предназначена, решение принимает человек.

  • Перенос резюме из PDF в карточку кандидата
  • Заполнение базы кандидатов без ручного ввода
  • Разбор резюме с разной вёрсткой и оформлением
Размеры
8B, дообучение Qwen3-VL-8B-Instruct
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Картинка + текстRU2025

A-Vision (Авито)

Авито Тех · Россия

Русскоязычная модель Авито, которая понимает картинки: описывает фото, отвечает на вопросы по изображению, читает надписи. Основа Qwen2.5-VL, на русском быстрее исходной.

  • Описание товара по фото на русском
  • Проверка, что фото совпадает с описанием
  • Чтение брендов и надписей на картинках
Размеры
7.4B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Картинка + текстGGUF2025

Kimi-VL

Moonshot AI · Китай

Экономичная MoE-модель зрения (16B, активны 3B) с длинным контекстом и рассуждающей версией. Хорошо разбирает длинные документы и видео.

  • Разбор длинных PDF и презентаций
  • Ответы на вопросы по видео
  • Работа с интерфейсами по скриншотам
Размеры
16B-A3B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Картинка + текстНе развивается2023–2024

IDEFICS

Hugging Face · Франция / США

Открытые модели зрения от Hugging Face, воспроизводившие закрытую Flamingo. Idefics3 стала основой для компактной линейки SmolVLM.

  • Ответы на вопросы по картинкам
  • Разбор документов и скриншотов
  • Основа для дообучения
Размеры
8B – 80B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее

Погода и климат 5

Погода и климат2024–2026

Ai2 ACE2 (климатический эмулятор)

Allen Institute for AI (Ai2) · США

Быстрый эмулятор климатической модели: моделирует атмосферу на годы и десятилетия вперёд на одной видеокарте. Есть связка с океаном (SamudrACE) для долгосрочных сценариев.

  • Сценарии климата на десятилетия для оценки долгосрочных рисков активов
  • Массовые расчёты «что если» по температуре и осадкам
  • Подготовка данных для моделей урожайности и спроса на энергию
Размеры
чекпоинт около 1,8 ГБ
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Погода и климат2023–2026

Google DeepMind GraphCast / GenCast / WeatherNext 2

Google DeepMind · Великобритания

Семейство глобальных погодных моделей Google DeepMind: GraphCast (прогноз на 10 дней), GenCast (ансамбль вероятностей) и WeatherNext 2 с прогнозом циклонов. С августа 2026 веса разрешены для коммерции.

  • Среднесрочный прогноз погоды для планирования смен, рейсов и поставок
  • Вероятностная оценка экстремальной погоды для страховых портфелей
  • Прогноз траекторий тропических циклонов для морских и портовых операций
Размеры
от облегчённых версий 1° до полных 0,25°
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Погода и климат2024–2026

Microsoft Aurora

Microsoft Research · США

Базовая модель атмосферы Земли: глобальный прогноз погоды, отдельные версии для качества воздуха и морских волн. Считает прогноз за секунды вместо часов на суперкомпьютере.

  • Собственный прогноз температуры, ветра и осадков по точкам присутствия компании
  • Оценка волнения моря для планирования рейсов и портовых работ
  • Прогноз загрязнения воздуха для промышленных площадок
Размеры
около 1,3B (есть малая версия для тестов)
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Погода и климат2022–2026

NVIDIA FourCastNet и модели Earth-2

NVIDIA · США

Набор погодных и климатических моделей NVIDIA: глобальный прогноз FourCastNet, детализация до километров (CorrDiff), прогноз гроз по региону (StormCast), генерация климата (cBottle, Atlas). Запускаются через Earth2Studio.

  • Глобальный прогноз с последующей детализацией на нужный регион
  • Краткосрочный прогноз гроз и сильных осадков для диспетчерских служб
  • Генерация множества погодных сценариев для стресс-тестов
Размеры
98M – 2,5B (FourCastNet 3 — около 711M)
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Погода и климат2024–2026

ECMWF AIFS

Европейский центр среднесрочных прогнозов погоды (ECMWF) · Европа (межправительственная организация)

Погодная нейросеть ECMWF, которая работает в оперативном режиме: прогноз на 15 дней четыре раза в сутки, ансамблевая версия на 51 сценарий, с версии 2 — волнение моря.

  • Собственный запуск прогноза от открытых начальных данных
  • Ансамблевые прогнозы для оценки вероятности заморозков, ливней, штормов
  • Прогноз волнения для морских операций
Размеры
чекпоинт около 1 ГБ
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее

Код 4

КодOllama2026

Ornith

DeepReinforce · не раскрыта

Модели для агентной разработки: сами строят план и обвязку под задачу и выполняют её в терминале. Дообучены на базе Qwen 3.5 и Gemma 4, работают с Claude Code, OpenHands и похожими инструментами.

  • Агент-разработчик в терминале
  • Исправление ошибок по описанию задачи
  • Разбор и доработка большого репозитория
Размеры
9B – 397B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Код2025–2026

KAT-Coder / KAT-Dev

Kwaipilot (Kuaishou) · Китай

Модели Kuaishou для агентной разработки, обученные решать реальные задачи в репозиториях. KAT-Coder-V2.5-Dev (35B, активны 3B) — открытая версия их закрытого флагмана.

  • Агент, исправляющий задачи в репозитории
  • Генерация и рефакторинг кода
  • Автоматизация рутинных задач разработки
Размеры
32B – 72B, 35B-A3B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
КодGGUF2026

Laguna

Poolside · США

Модели для агентного программирования: самостоятельно правят код в репозитории. Младшая XS запускается на Mac с 36 ГБ памяти, у S 2.1 контекст 1M токенов.

  • Агент-программист для внутренней разработки
  • Исправление ошибок и доработка кода
  • Работа с большими кодовыми базами
Размеры
33B-A3B – 225B-A23B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
КодRUOllama2025

Devstral

Mistral AI (с All Hands AI) · Франция

Модели Mistral для агентной разработки: сами читают репозиторий, правят файлы и запускают команды. Версия 24B помещается на одну видеокарту.

  • Агент-разработчик для исправления задач из трекера
  • Доработка внутренних систем по описанию
  • Автоматизация рутинных правок в коде
Размеры
24B – 123B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее

Музыка и звук 4

Музыка и звукGGUF2025–2026

YuE

M-A-P и HKUST · Китай

Генерация полноценных песен с вокалом и аккомпанементом по тексту и описанию стиля: английский, китайский, японский, корейский.

  • Песни и джинглы по тексту
  • Демо-версии композиций
  • Музыка для роликов
Размеры
0.5B – 7B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Музыка и звук2026

HeartMuLa

HeartMuLa Team · не указана

Открытая модель генерации песен с вокалом на китайском, английском, японском, корейском и испанском, плюс кодек и модель расшифровки текста песен.

  • Песни и джинглы по тексту
  • Музыка для роликов
  • Расшифровка текста песен
Размеры
3B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Музыка и звук2025–2026

ThinkSound / PrismAudio

Alibaba Tongyi (FunAudioLLM) · Китай

Генерирует и редактирует звук к видео, тексту или аудио, сначала «рассуждая» о сцене через мультимодальную модель. PrismAudio — следующая версия для звука к видео.

  • Звук к видео по сцене
  • Редактирование отдельных звуков в дорожке
  • Звуковые эффекты по описанию
Размеры
размер на карточке не указан
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Музыка и звук2025

HunyuanVideo-Foley

Tencent Hunyuan · Китай

Генерирует звук студийного качества (48 кГц) к видео по картинке и текстовой подсказке: шаги, удары, окружение, синхронно с действием в кадре.

  • Фоли и звуковые эффекты к видео
  • Озвучка ИИ-роликов для рекламы
  • Саунд-дизайн для коротких видео
Размеры
не указан в карточке (веса около 10 ГБ; XL-версия с выгрузкой в память)
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее

Обработка фото 4

Обработка фото2025

SeedVR / SeedVR2

ByteDance Seed · Китай

Восстановление и увеличение видео и фото от ByteDance. SeedVR2 делает это за один шаг, поэтому заметно быстрее похожих моделей. Коммерческая лицензия.

  • Увеличение фото и видео до 2K–4K
  • Восстановление старых роликов и снимков
  • Улучшение пользовательских фото перед публикацией
Размеры
3B – 7B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Обработка фото2024

Flux.1-dev ControlNet Upscaler

Jasper AI · США

Дополнение к FLUX для увеличения маленьких и размытых картинок с дорисовкой деталей. Популярно, но под некоммерческой лицензией FLUX dev.

  • Увеличение мелких картинок с дорисовкой
  • Улучшение сгенерированных изображений
  • Пилоты апскейла для каталога
Размеры
дополнение к FLUX.1 dev 12B
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Обработка фотоНе развивается2024

SUPIR

XPixel Group (Шэньчжэньский институт передовых технологий АН Китая, Shanghai AI Lab и др.) · Китай

Мощное восстановление сильно испорченных фото на базе SDXL: дорисовывает детали, а не просто увеличивает. Требовательна к железу, лицензия некоммерческая.

  • Восстановление старых и размытых фото
  • Увеличение снимков с дорисовкой деталей
  • Пилоты реставрации архивов
Размеры
на базе SDXL, плюс LLaVA 13B для описаний
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Обработка фотоНе развивается2023

StableSR

S-Lab, Наньянский технологический университет · Сингапур

Одна из первых моделей увеличения фото на базе Stable Diffusion: восстанавливает реалистичные детали. Лицензия некоммерческая.

  • Увеличение фото с дорисовкой деталей
  • Исследовательские пилоты реставрации
  • Сравнение с классическими апскейлерами
Размеры
на базе SD 2.1
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее

Агенты для компьютера 4

Агенты для компьютера2025–2026

OpenCUA / Qwen-CUA

XLANG Lab (Гонконгский университет) · Китай

Полностью открытые агенты для рабочего стола: веса, данные и код обучения. Работают в Windows, macOS и Linux, свежий Qwen-CUA управляет компьютером обычными кликами и клавишами.

  • Работа в настольных программах без API
  • Перенос данных между системами
  • Прогон пользовательских сценариев для тестов
Размеры
7B – около 400B (MoE)
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Агенты для компьютераGGUF2026

EvoCUA

Meituan · Китай

Агент Meituan для управления компьютером, обученный на большом числе смоделированных задач в настольных программах. На выходе даёт клики и ввод с клавиатуры.

  • Работа в офисных и старых программах без API
  • Перенос данных между системами
  • Прогон сценариев для тестов
Размеры
8B – 32B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Агенты для компьютера2023–2025

CogAgent / AutoGLM

Zhipu AI (Z.ai) и Университет Цинхуа · Китай

Одна из первых открытых моделей для управления интерфейсом по скриншоту, развитие — AutoGLM-Phone для работы в приложениях смартфона на Android.

  • Автоматизация действий в мобильных приложениях
  • Работа в веб-интерфейсах без API
  • Тестирование приложений по сценарию
Размеры
9B – 18B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Агенты для компьютераGGUF2025

Magma

Microsoft Research · США

Модель-агент, которая одинаково планирует действия и в интерфейсе (кнопки на экране), и для робота (движения манипулятора). Пока скорее исследовательская база, чем готовый продукт.

  • Пилоты по управлению интерфейсом
  • Исследовательские проекты на стыке экрана и робототехники
  • Разбор скриншотов с планом действий
Размеры
8B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее

Биология и химия 4

Биология и химия2022–2026

OpenFold / OpenFold3

Лаборатория AlQuraishi (Колумбийский университет) и консорциум OpenFold · США

Полностью открытое воспроизведение AlphaFold 2, а затем AlphaFold 3 под Apache 2.0 с обучающими данными. OpenFold3 предсказывает комплексы белков, нуклеиновых кислот и лигандов.

  • Предсказание структуры белков и комплексов с лигандами
  • Дообучение на собственных данных компании (код обучения открыт)
  • Внутренний сервис структурного анализа без передачи данных наружу
Размеры
один набор весов на версию
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Биология и химия2024–2026

Arc Institute Evo / Evo 2

Arc Institute (с Together AI, Stanford, NVIDIA) · США

Языковые модели ДНК с контекстом до миллиона нуклеотидов: оценивают влияние мутаций, аннотируют геномы и генерируют последовательности. Evo 2 обучена на геномах всех царств жизни.

  • Оценка вероятной вредности генетических вариантов для исследований
  • Аннотация геномов микроорганизмов и растений
  • Поиск перспективных последовательностей в селекции и синтетической биологии
Размеры
1B – 40B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Биология и химия2024–2025

Boltz (Boltz-1, Boltz-2, BoltzGen)

MIT (Jameel Clinic) и Recursion · США

Открытая альтернатива AlphaFold 3 под MIT: предсказывает структуру комплексов белков, ДНК и малых молекул, Boltz-2 оценивает силу связывания, BoltzGen проектирует новые связывающие белки.

  • Предсказание, как молекула-кандидат садится в белок-мишень
  • Ранжирование соединений по прогнозу силы связывания до синтеза
  • Проектирование белков-связывателей под заданную мишень
Размеры
чекпоинты около 2 ГБ
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Биология и химия2024

AlphaFold 3

Google DeepMind и Isomorphic Labs · Великобритания

Эталонная модель структуры биомолекул и их комплексов. Веса выдаются только для некоммерческих исследований; компаниям нужен коммерческий доступ через облако Google или открытые аналоги (Boltz, OpenFold3).

  • Академические исследования структуры белков и комплексов
  • Сравнение открытых аналогов с эталоном на своих мишенях
Размеры
один набор весов
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее

Финансы 4

Финансы2025

Fino1 / Fin-o1

The Fin AI · международный проект

Модели, которые перед ответом проговаривают ход рассуждения по финансовым задачам с числами и таблицами. Не инвестиционная рекомендация: решения принимает специалист.

  • Расчётные вопросы по отчётности с показом хода решения
  • Разбор задач с таблицами и числами из документов
  • Проверка расчётов, сделанных вручную
Размеры
8B и 14B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Финансы2023–2024

XuanYuan

Du Xiaoman (Duxiaoman-DI) · Китай

Крупное китайское семейство моделей для финансовой отрасли: консультации, разбор документов и длинные тексты до 8k–16k. Не инвестиционная рекомендация: решения принимает специалист.

  • Ответы на вопросы клиентов по банковским продуктам
  • Разбор длинных финансовых документов
  • Внутренний помощник по регламентам финансовой компании
Размеры
6B – 176B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Финансы2023–2024

FinGPT

AI4Finance Foundation · США

Открытый набор лёгких надстроек к обычным языковым моделям для работы с финансовыми текстами и новостями. Не инвестиционная рекомендация: решения принимает специалист.

  • Оценка тона финансовых новостей и отчётов
  • Разметка упоминаний компаний и инструментов в тексте
  • Подготовка сводок по потоку деловых новостей
Размеры
адаптеры к базовым моделям 6B – 20B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
ФинансыНе развивается2023

DISC-FinLLM

Fudan-DISC, Университет Фудань · Китай

Финансовый помощник из нескольких дообученных экспертов: консультации, расчёты, разбор документов и поиск по базе знаний. Не инвестиционная рекомендация: решения принимает специалист.

  • Консультации по финансовым вопросам внутри компании
  • Разбор финансовых документов и новостей
  • Подсказки сотрудникам фронт-офиса
Размеры
13B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее

Медицина 3

МедицинаGGUF2025–2026

AntAngelMed

Ant Healthcare (Ant Group) и Центр медицинской информации провинции Чжэцзян · Китай

Крупная медицинская MoE-модель на базе Ling-flash-2.0: 100B параметров, из них в работе 6B, поэтому отвечает быстро. Не заменяет врача, решения принимает специалист.

  • Справочные ответы персоналу по клиническим вопросам
  • Черновики выписок для проверки врачом
  • Поиск по медицинской литературе
Размеры
100B-A6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
МедицинаНе развивается2023

Clinical Camel

Лаборатория Бо Ванга (Университет Торонто, Vector Institute) · Канада

Ранняя медицинская модель на Llama 2 70B, обученная на диалогах по медицинским текстам. Сейчас интересна в основном для исследований. Не заменяет врача, решения принимает специалист.

  • Исследовательские пилоты по медицинским диалогам
  • Учебные материалы для персонала
  • Сравнение с новыми медицинскими моделями
Размеры
70B
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
МедицинаНе развивается2023

RadFM

Шанхайский университет Цзяо Тун и Shanghai AI Lab · Китай

Ранняя общая модель для радиологии: понимает 2D- и 3D-снимки (КТ, МРТ) вместе с текстом. Скорее исследовательская база. Не заменяет врача, решения принимает специалист.

  • Исследовательские пилоты по разбору КТ и МРТ
  • Подсказки при разборе снимков для врача
  • Основа для своего дообучения на снимках клиники
Размеры
размер на карточке не указан
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее

Документы и OCR 3

Документы и OCR2026

jina-ocr-v1

Jina AI · Германия

Разбор документов одной моделью: страница целиком превращается в Markdown — текст в правильном порядке чтения, таблицы и формулы в LaTeX. Построена на DeepSeek-OCR, активны только 0,6 млрд параметров из 3,4.

  • Перевод сканов и PDF в Markdown
  • Распознавание таблиц и формул
  • Разбор счетов, актов и отчётов
Размеры
3.4B-A0.6B
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Документы и OCRGGUF2025

olmOCR

Ai2 (Allen Institute for AI) · США

Модель и набор инструментов для массового перевода PDF в чистый текст с сохранением порядка чтения, таблиц и формул. Рассчитана на обработку миллионов страниц.

  • Массовая оцифровка архива PDF
  • Распознавание договоров и отчётов в текст
  • Подготовка документов для поиска и RAG
Размеры
7B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Документы и OCRНе развивается2024

Kosmos-2.5

Microsoft · США

Превращает скан страницы в размеченный текст с координатами блоков или в markdown. Удобна как первый шаг перед разбором резюме. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.

  • Перевод сканов резюме в текст с сохранением структуры
  • Подготовка документов к извлечению полей
  • Оцифровка бумажных анкет
Размеры
около 1.4B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее

Табличные данные 3

Табличные данные2026

TabFM

Google Research · США

Крупная табличная модель Google: классификация и регрессия по примерам без обучения, с числовыми и категориальными столбцами. Веса только для некоммерческого использования.

  • Пилотное сравнение с текущими моделями скоринга
  • Исследование данных о клиентах
  • Проверка гипотез по оттоку
Размеры
около 1.6B
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Табличные данныеGGUF2024–2025

TableGPT2 / TableGPT-R1

Чжэцзянский университет · Китай

Семейство для работы с таблицами и базами: понимает структуру данных, пишет код разбора и отвечает на вопросы по выгрузкам.

  • Ответы на вопросы по таблицам и выгрузкам
  • Автоматический разбор данных с написанием кода
  • Помощник в BI и внутренней отчётности
Размеры
7B – 72B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Табличные данныеНе развивается2024

TabuLa-8B

ML Foundations · США

Базовая модель для предсказаний по таблицам: делает классификацию и прогноз по нескольким примерам, без отдельного обучения под задачу.

  • Классификация записей в таблице по нескольким примерам
  • Прогноз значения по строке данных
  • Быстрая проверка гипотез на новых наборах данных
Размеры
8B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее

Лица 3

Лица2025

InfiniteYou

ByteDance · Китай

Генерация картинок с сохранением лица на базе FLUX: лучше следует описанию и реже копирует лицо как наклейку. Лицензия только исследовательская.

  • Портреты по одному фото с точным описанием сцены
  • Тесты персонажей для рекламы
  • Сравнение методов сохранения лица
Размеры
адаптер к FLUX.1-dev
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Лица2024

PuLID

ByteDance · Китай

Сохраняет лицо человека при генерации картинок по одному фото и меньше портит стиль и фон. Есть версии для SDXL и FLUX, вторая идёт на карте 16 ГБ.

  • Портреты и аватары по одному фото
  • Персонажи для рекламы с узнаваемым лицом
  • Прототипы фотосессий
Размеры
адаптеры к SDXL и FLUX.1-dev
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
ЛицаНе развивается2024

InstantID

InstantX (Xiaohongshu) · Китай

Генерирует картинки с лицом конкретного человека по одному фото, без дообучения. Популярен в ComfyUI, но веса только для исследований.

  • Портреты в разных стилях по одному фото
  • Эскизы аватаров и персонажей
  • Прототипы фотосессий
Размеры
адаптер к SDXL
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее

Детекция подделок 3

Детекция подделок2024–2025

AIDE

Xiaohongshu, USTC и Shanghai Jiao Tong University · Китай

Детектор ИИ-картинок из нескольких экспертов: одни смотрят на визуальные артефакты, другие на шум. Вместе с ним выпущен сложный набор Chameleon. Ошибается в обе стороны — итог проверяет человек.

  • Проверка реалистичных ИИ-изображений без явных артефактов
  • Сравнение детекторов на сложных примерах
  • Дообучение под свой тип контента
Размеры
несколько экспертов на базе ConvNeXt и CLIP
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Детекция подделок2022–2025

TruFor

GRIP, University Federico II of Naples · Италия

Ищет следы монтажа и показывает картой, какие участки изображения выглядят изменёнными: подходит для сканов договоров, справок и фото документов. Ошибается в обе стороны — решение принимает человек.

  • Проверка сканов справок и договоров на правку
  • Подсветка изменённых участков фото для эксперта
  • Отсев явно перерисованных документов до ручной проверки
Размеры
трансформерная модель с картой подозрительных областей
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Детекция подделокНе развивается2023–2024

IML-ViT

Sichuan University и соавторы · Китай

Открытая модель поиска подделок в изображениях: выдаёт попиксельную маску изменённых участков. Ошибается в обе стороны, её карта — подсказка эксперту, а не доказательство подделки.

  • Поиск вклеенных и затёртых фрагментов на фото
  • Проверка сканов документов на правку
  • Базовая линия при сравнении моделей поиска монтажа
Размеры
модель на базе Vision Transformer
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее

Проверка фактов и оценка ответов 3

Проверка фактов и оценка ответов2025

Atla Selene

Atla · Великобритания

Модель-судья на 8B: оценивает ответ другой модели по вашим критериям и пишет обоснование. Судья сам ошибается, на важных задачах ручную проверку он не заменяет.

  • Оценка ответов чат-бота по своим критериям
  • Сравнение двух версий подсказки или модели
  • Отбраковка слабых ответов перед отправкой человеку
Размеры
8B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Проверка фактов и оценка ответовНе развивается2024

Patronus Lynx

Patronus AI · США

Проверяет, не придумал ли чат-бот факт, которого нет в исходных документах. Лицензия некоммерческая. Проверяющая модель сама ошибается и ручную проверку на важных задачах не заменяет.

  • Поиск выдуманных фактов в ответах ИИ-помощника
  • Проверка ответов на опору в приложенных документах
  • Отбраковка ответов перед отправкой клиенту
Размеры
8B и 70B
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Проверка фактов и оценка ответовНе развивается2024

ArmoRM (RLHFlow)

RLHFlow · США

Оценщик ответов, который выдаёт не один общий балл, а разбор сразу по нескольким признакам. Оценщик сам ошибается и ручную проверку на важных задачах не заменяет.

  • Отбор лучшего из нескольких вариантов ответа
  • Подготовка данных для дообучения модели
  • Оценка ответов помощника по нескольким признакам
Размеры
8B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее

Модерация и безопасность 2

Модерация и безопасностьOllama2025

gpt-oss-safeguard

OpenAI · США

Модерация по вашим правилам: политику пишете обычным текстом, модель рассуждает и выносит решение с объяснением. Построена на gpt-oss.

  • Модерация по внутренним правилам компании
  • Разметка спорных сообщений с объяснением
  • Проверка отзывов и объявлений перед публикацией
Размеры
20B – 120B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Модерация и безопасностьGGUFНе развивается2024

WildGuard

Ai2 (Allen Institute for AI) · США

Открытый фильтр Ai2: одним проходом определяет, опасен ли запрос, опасен ли ответ и не отказал ли бот зря. Работает на английском.

  • Проверка запросов к боту
  • Проверка ответов бота
  • Поиск лишних отказов бота на безобидные вопросы
Размеры
7B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее

Голосовые ассистенты 2

Голосовые ассистентыGGUF2026

PersonaPlex

NVIDIA · США

Голосовой собеседник на основе Moshi, который слушает и говорит одновременно, позволяет себя перебивать. Роль задаётся текстом, голос — образцом записи. Только английский.

  • Голосовой ассистент с заданной ролью
  • Тренажёр разговоров для обучения персонала
  • Голосовые интерфейсы без задержки
Размеры
7B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Голосовые ассистенты2025

Kimi-Audio

Moonshot AI · Китай

Универсальная аудиомодель: распознаёт речь, отвечает на вопросы о звуке, определяет эмоции и ведёт голосовой диалог. Обучена на 13 млн часов аудио, языки — английский и китайский.

  • Распознавание речи
  • Определение эмоций и звуковых событий
  • Голосовой диалог речь-в-речь
Размеры
7B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее

Автономное вождение 2

Автономное вождение2025–2026

NVIDIA Alpamayo

NVIDIA · США

Модели «зрение–язык–действие» для беспилотников: по видео с камер строят траекторию и объясняют решение текстом. Используются для разработки и проверки систем автопилота, а не как готовый автопилот.

  • Авторазметка записей с камер для обучения своих систем помощи водителю
  • Разбор сложных дорожных сцен с текстовым объяснением
  • Проверка систем автопилота в симуляторе на редких сценариях
Размеры
10B – 34B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Автономное вождение2026

Qwen-Drive

Alibaba (команда Qwen) · Китай

Модель для автономного вождения на базе Qwen3.5-4B: 3D-распознавание объектов вокруг машины, ответы на вопросы о дорожной сцене и планирование траектории в одной модели.

  • Прототип восприятия и планирования для беспилотной техники на закрытой территории
  • Ответы на вопросы о записях с камер при разборе инцидентов
  • Разметка дорожных сцен для обучения своих моделей
Размеры
4B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее

Математика и рассуждения 1

Математика и рассужденияOllama2024–2025

QwQ

Qwen (Alibaba) · Китай

Первая открытая рассуждающая модель Qwen: думает по шагам перед ответом и на задачах по математике близка к DeepSeek-R1 при 32B параметров.

  • Расчёты и проверка формул
  • Сложная аналитика с пошаговым разбором
  • Проверка логики договоров и регламентов
Размеры
32B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее

Синтез речи 1

Синтез речиRUGGUF2025–2026

Higgs Audio

Boson AI · США

Выразительный синтез речи и диалогов с клонированием голоса, плюс модели распознавания. Третья версия синтеза поддерживает около 100 языков, включая русский, но некоммерческая.

  • Выразительная озвучка роликов
  • Озвучка диалогов
  • Клонирование голоса
Размеры
около 3B – 8B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее

Перевод 1

ПереводRUНе развивается2023–2024

ALMA и X-ALMA

Университет Джонса Хопкинса и Microsoft · США

Исследовательские переводчики на основе Llama 2. Первая ALMA знала 5 пар с английским, включая русский; X-ALMA расширила охват до 50 языков.

  • Перевод между английским и русским
  • Эксперименты с переводом на базе языковых моделей
  • Основа для дообучения переводчика
Размеры
7B – 13B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее

Голос: спикеры и звук 1

Голос: спикеры и звук2025

SAM Audio

Meta · США

Модель вырезает из записи нужный звук по текстовому описанию, по отметке на видео или по отрезку: голос, инструмент, шум. Доступ к весам выдают по заявке.

  • Выделить голос одного человека из шумной записи
  • Убрать посторонний звук из видео
  • Разобрать запись на отдельные источники звука
Размеры
small, base, large (от 5 до 15 ГБ весов)
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее

Кибербезопасность 1

КибербезопасностьGGUF2025

Trendyol Cybersecurity LLM

Trendyol · Турция

Модели безопасности от крупного турецкого маркетплейса, выложены в формате GGUF: разбор алертов и инцидентов, английский и турецкий языки.

  • Разбор алертов и первичная оценка инцидента
  • Объяснение подозрительной активности в отчётах
  • Помощь дежурной смене центра мониторинга
Размеры
32B и 70B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее

Реранкеры 1

РеранкерыGGUFНе развивается2023–2024

RankVicuna / RankLLaMA / RankZephyr (Castorini)

Университет Ватерлоо, группа Castorini · Канада

Реранкеры-языковые модели: получают сразу список найденных фрагментов и переставляют его целиком, а не оценивают фрагменты по одному. Тяжелее обычных реранкеров.

  • Переупорядочивание длинной выдачи поиска
  • Отбор источников для ответа ИИ-помощника
  • Исследовательские сравнения способов поиска
Размеры
7B – 13B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее

Где обычно упираются

Считать нужно не по числу параметров, а по видеопамяти: её съедают и сами веса, и контекст, и очередь запросов. Модель, которая «влезает» по весам ровно впритык, на длинном документе упадёт. Закладывайте запас и проверяйте на своём сценарии, а не на демонстрационном примере.

По железу

Нужна модель под вашу задачу?

Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.

  1. ПодберуМодель и размер под задачу и бюджет на железо
  2. ПоставлюНа ваш сервер или в закрытый контур, с API
  3. ДообучуНа ваших данных или подключу базу знаний
  4. ВстроюВ CRM, 1С, бота, сайт или рабочий чат
Обсудить внедрение