Открытые ИИ-модели

Модели с открытыми весами с 2022 года: текст, код, картинки, видео, речь, 3D. По каждой коротко: какие задачи решает, где применяется, какое нужно железо и можно ли в коммерцию. Любую из них поставлю на ваш сервер и дообучу под вашу задачу.

314 семейств23 направленийОбновлено 22.09.2026Путеводитель: как выбрать модель

Показано 314 из 314

Картинки2025–2026

Qwen-Image

Alibaba · Китай

Генерация и редактирование картинок, в том числе с текстом на изображении. Ранние версии можно в коммерцию, свежая 2.1 — только некоммерческая.

  • Инфографика для карточек товаров
  • Правка фото по текстовой команде
  • Рекламные креативы
Размеры
7B – 20B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Медицина2023–2026

HuatuoGPT

FreedomIntelligence (Китайский университет Гонконга, Шэньчжэнь) · Китай

Большое семейство медицинских моделей: чат, версия со снимками, рассуждающая HuatuoGPT-o1 и новая HuatuoGPT-3 на Qwen3. Не заменяет врача, решения принимает специалист.

  • Черновики выписок для проверки врачом
  • Поиск по медицинской литературе
  • Подсказки при разборе снимков для врача (Vision)
Размеры
7B – 72B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текст2025–2026

VibeVoice

Microsoft · США

Речевые модели Microsoft: синтез длинных диалогов на несколько голосов, быстрый синтез для живого общения и распознавание длинных записей с разделением по говорящим, в том числе на русском.

  • Расшифровка длинных встреч с разметкой говорящих
  • Озвучка подкастов и диалогов
  • Голос для ассистентов в реальном времени
Размеры
0.5B – 9B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Музыка и звук2025–2026

YuE

M-A-P и HKUST · Китай

Генерация полноценных песен с вокалом и аккомпанементом по тексту и описанию стиля: английский, китайский, японский, корейский.

  • Песни и джинглы по тексту
  • Демо-версии композиций
  • Музыка для роликов
Размеры
0.5B – 7B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Музыка и звук2026

HeartMuLa

HeartMuLa Team · не указана

Открытая модель генерации песен с вокалом на китайском, английском, японском, корейском и испанском, плюс кодек и модель расшифровки текста песен.

  • Песни и джинглы по тексту
  • Музыка для роликов
  • Расшифровка текста песен
Размеры
3B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Текст2023–2026

DeepSeek

DeepSeek · Китай

Флагманская линия DeepSeek: от первых 7B/67B до V4-Pro на 1,6 трлн параметров. Уровень закрытых моделей при открытой MIT-лицензии; V4.1-Flash понимает картинки и держит контекст до 1 млн токенов.

  • Ассистент для сотрудников на своём сервере
  • Разбор длинных договоров и отчётов
  • Агенты, которые работают с инструментами и API
Размеры
7B – 1.6T-A49B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2023–2026

InternLM / Intern-S

Shanghai AI Laboratory · Китай

Модели Шанхайской лаборатории ИИ. Ранняя линия InternLM — универсальная, новая Intern-S1/S2 — научная: понимает формулы, молекулы, графики и картинки.

  • Помощник исследователя: статьи, формулы, данные
  • Разбор научных и технических документов
  • Корпоративный чат на малых моделях
Размеры
1.8B – около 1T
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2025–2026

MiMo

Xiaomi · Китай

Модели Xiaomi для рассуждений и агентов: от компактной MiMo-7B до MiMo-V2.6-Pro на 1 трлн параметров. Flash-версии задействуют всего 15 млрд параметров на токен.

  • Логические и расчётные задачи
  • Агенты с инструментами
  • Помощь программистам
Размеры
7B – 1T-A42B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2024–2026

GigaChat

Сбер · Россия

Открытые модели Сбера, обученные с упором на русский язык: хорошо пишут и понимают по-русски, знают местные реалии. Есть лёгкая 10B-A1.8B и флагманы до 702B, всё под MIT.

  • Русскоязычный ассистент для сотрудников на своём сервере
  • Ответы клиентам и разбор обращений на русском
  • Работа с договорами и внутренними регламентами
Размеры
10B-A1.8B – 702B-A36B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2022–2026

YandexGPT / AliceAI

Яндекс · Россия

Модели Яндекса, обученные с нуля с упором на русский язык и российские реалии. Новая AliceAI-Foundation 80B-A3B — базовая модель под Apache 2.0, её дообучают под свои задачи.

  • Русскоязычный ассистент и чат-бот
  • Ответы на вопросы по базе знаний компании
  • Основа для дообучения под свою отрасль
Размеры
8B – 100B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Текст2024–2026

Aya

Cohere Labs · Канада

Многоязычные модели исследовательского крыла Cohere, от 23 до 100+ языков. Tiny Aya 2026 года на 3.3B работает на обычном ПК, но только некоммерчески.

  • Перевод и переписка на редких языках
  • Многоязычный чат-ассистент
  • Разбор изображений с текстом (Vision)
Размеры
3.3B – 35B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Текст2023–2026

Qwen

Alibaba · Китай

Семейство языковых моделей с сильным русским языком: от маленьких версий для ноутбука до флагмана уровня коммерческих API.

  • Чат-бот и ассистент по базе знаний
  • Ответы на письма и обращения
  • Разбор и классификация документов
Размеры
0,6B – 2,4T
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Видео2025–2026

MAGI

Sand AI · Китай

Видео, которое генерируется по кускам друг за другом, поэтому ролик можно продлевать бесконечно. MAGI-2 делает видео сразу со звуком.

  • Длинные ролики с продолжением
  • Видео со звуком
  • Оживление изображений
Размеры
4.5B – 114B-A6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Видео2025–2026

SANA-Video

NVIDIA · США

Лёгкая и быстрая видеомодель NVIDIA. Выдаёт 720p-ролики на одной видеокарте, есть версия на 4 шага для быстрой генерации.

  • Быстрые ролики для соцсетей
  • Массовая генерация видео
  • Видео из картинки
Размеры
2B – 5B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Компьютерное зрение2024–2026

MoGe

Microsoft Research · США

Восстанавливает 3D-геометрию сцены по одной фотографии: глубину в метрах, облако точек и нормали поверхностей.

  • Замеры помещений и объектов по фото
  • 3D-облако точек из снимка
  • Подготовка данных для роботов и AR
Размеры
ViT-S – ViT-G
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Поиск и RAG2024–2026

FRIDA / Giga-Embeddings

Сбер (SberDevices) · Россия

Эмбеддинги Сбера, заточенные под русский язык: одни из лучших на русскоязычных тестах поиска. FRIDA компактная, Giga-Embeddings мощнее.

  • Поиск по русскоязычным документам
  • RAG для чат-ботов на русском
  • Классификация обращений и отзывов
Размеры
480M – 10B-A1.8B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Прогнозы2024–2026

TimesFM

Google · США

Готовая модель прогнозов Google: строит прогноз по любому временному ряду без обучения на ваших данных.

  • Прогноз продаж и спроса
  • Планирование закупок и запасов
  • Прогноз нагрузки и трафика
Размеры
200M – 500M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Роботы2025–2026

GigaBrain

GigaAI · Китай

Модель управления роботами, обученная в основном на синтетических данных из модели мира. Позволяет меньше тратить на сбор данных с реальных роботов.

  • Управление манипулятором
  • Дообучение на малом объёме своих данных
  • Пилоты сортировки и сборки
Размеры
3.5B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Речь в текст2024–2026

Moonshine

Moonshine AI (Useful Sensors) · США

Очень маленькие и быстрые модели распознавания речи для телефонов, планшетов и встраиваемых устройств. Вторая версия работает потоково и выдаёт текст, пока человек ещё говорит.

  • Голосовое управление устройствами
  • Распознавание на телефоне без интернета
  • Живые субтитры
Размеры
27M – 245M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текст2025–2026

Granite Speech

IBM · США

Речевые модели IBM для распознавания и перевода речи на английском и нескольких европейских языках и японском. Рассчитаны на корпоративное использование.

  • Расшифровка деловых встреч
  • Перевод речи в текст на другом языке
  • Голосовые ассистенты
Размеры
470M – 8B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речи2025–2026

IndexTTS

bilibili · Китай

Синтез речи с клонированием голоса и точным контролем длительности, удобен для дубляжа видео. Управляет эмоциями отдельно от тембра.

  • Дубляж видео с попаданием в тайминг
  • Клонирование голоса
  • Эмоциональная озвучка
Размеры
около 1B – 2B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Текст2023–2026

GLM (ChatGLM)

Zhipu AI (Z.ai) · Китай

Одна из старейших китайских открытых линий: от ChatGLM-6B до GLM-5.3. Сильна в агентных задачах и программировании; GLM-5.3-Flash понимает картинки и выходит под MIT.

  • Корпоративный чат-ассистент
  • Агенты для рутинных офисных задач
  • Помощь программистам
Размеры
1.5B – 744B-A40B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Текст2024–2026

Hunyuan / Hy

Tencent · Китай

Языковые модели Tencent: от малых 0.5B–7B до Hy4-preview на 770 млрд параметров. С 2026 года линия переименована в Hy, а новые версии вышли под Apache 2.0.

  • Корпоративный ассистент
  • Перевод и работа с многоязычными текстами
  • Агенты с инструментами
Размеры
0.5B – 770B-A49B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Текст2025–2026

Ling / Ring

Ant Group (inclusionAI) · Китай

Семейство Ant Group: Ling — обычные модели, Ring — рассуждающие. Есть и триллионные флагманы, и экономичная Ling-3.0-tiny, которой хватает 1,3 млрд активных параметров.

  • Корпоративный ассистент
  • Агенты для офисных процессов
  • Финансовая аналитика (есть версия Fin)
Размеры
7.9B-A1.3B – 1T
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2024–2026

NVIDIA Nemotron

NVIDIA · США

Модели NVIDIA для агентов и рассуждений, заточенные под быстрый запуск на её видеокартах. Nemotron 3 это гибрид Mamba и MoE от 4B до 550B.

  • Агенты с вызовом инструментов
  • Задачи с рассуждением и расчётами
  • Ответы по длинным документам
Размеры
4B – 550B-A55B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Текст2024–2026

IBM Granite

IBM · США

Корпоративные модели IBM с прозрачными данными обучения и сертификацией ISO 42001. Granite 4 это гибрид Mamba и трансформера, экономный по памяти.

  • Ответы по внутренним документам (RAG)
  • Вызов инструментов и работа в агентах
  • Извлечение данных и классификация
Размеры
350M – 34B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2025–2026

Liquid LFM

Liquid AI · США

Модели новой архитектуры для работы прямо на устройстве: быстрые на обычном процессоре и в телефоне. Есть версии для извлечения данных, RAG и инструментов.

  • Ассистент на ноутбуке или телефоне без интернета
  • Извлечение данных из документов
  • Вызов инструментов в приложениях
Размеры
230M – 24B-A2B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Текст2026

Muse Glimmer

Meta Superintelligence Labs · США

Открытая модель Meta для агентов на доступном железе: дистиллирована из закрытой Muse Spark, понимает текст и картинки, обучена на 100+ языках.

  • Агенты с вызовом инструментов
  • Разбор скриншотов, графиков и документов
  • Многоязычный ассистент
Размеры
30B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Разбор текста2024–2026

GLiNER

Урчаде Заратиана и Fastino AI · Франция / США

Находит в тексте нужные сущности без обучения: просто перечисляете, что искать (имя, сумма, дата). GLiNER2 заодно классифицирует текст. Многоязычные версии понимают русский.

  • Извлечение имён, сумм и дат из писем и договоров
  • Разбор заявок на поля CRM
  • Классификация обращений по темам
Размеры
около 50M – 500M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCR2026

TeleOCR

TeleAI (China Telecom) · Китай

Новая лёгкая модель для разбора документов, на момент выхода лидер теста OmniDocBench v1.6. Хорошо справляется со снятыми на телефон и помятыми страницами. Языки в карточке — китайский, английский, японский.

  • Распознавание счетов и накладных, снятых на телефон
  • Распознавание таблиц и формул
  • Перевод документов в Markdown для RAG
Размеры
около 1.2B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Видео2025–2026

Wan

Alibaba · Китай

Генерация видео по тексту и по картинке. Младшая версия запускается на игровой видеокарте. После 2.2 базовые модели открыто не выходят, только прикладные.

  • Короткие рекламные ролики
  • Оживление фото товара
  • Видео для соцсетей
Размеры
1,3B – 14B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Код2025–2026

KAT-Coder / KAT-Dev

Kwaipilot (Kuaishou) · Китай

Модели Kuaishou для агентной разработки, обученные решать реальные задачи в репозиториях. KAT-Coder-V2.5-Dev (35B, активны 3B) — открытая версия их закрытого флагмана.

  • Агент, исправляющий задачи в репозитории
  • Генерация и рефакторинг кода
  • Автоматизация рутинных задач разработки
Размеры
32B – 72B, 35B-A3B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Картинки2022–2026

Kandinsky

Сбер (Kandinsky Lab) · Россия

Российское семейство генерации картинок и видео от Сбера. Хорошо понимает запросы на русском и российский культурный контекст, открыто под MIT.

  • Картинки по описанию на русском
  • Короткие рекламные ролики из текста или фото
  • Редактирование изображений по инструкции
Размеры
2B – 19B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Картинки2025–2026

Chroma

lodestones (независимый разработчик) · нет данных

Общественная модель, переобученная из FLUX.1-schnell с упрощённой архитектурой. Без цензуры стилей, популярна как база для дообучения.

  • База для дообучения своих стилей
  • Художественные иллюстрации
  • Картинки для игр
Размеры
4B – 8.9B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Видео2024–2026

LTX-Video / LTX-2

Lightricks · Израиль

Быстрая видеомодель, которая с LTX-2 генерирует видео сразу со звуком и речью. Можно управлять камерой и позой, есть облегчённые версии.

  • Рекламные ролики со звуком
  • Видео из фото товара
  • Озвученные сцены для соцсетей
Размеры
2B – 22B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Видео2026

MiniMax H3 (Hailuo)

MiniMax · Китай

Открытые веса видеомодели Hailuo от MiniMax. Крупная модель на 33B, делает видео по тексту и картинке, но требует нескольких серверных видеокарт.

  • Кинематографичные рекламные ролики
  • Видео по тексту и картинке
  • Сложные сцены с движением
Размеры
33B + кодировщик 32B
Железо
от: Кластер
Коммерция с условиямиПодробнее
Поиск и RAG2025–2026

NVIDIA Nemotron Embed

NVIDIA · США

Эмбеддинги NVIDIA для поиска и RAG. Nemotron-3-Embed 2026 года вышли под свободной лицензией OpenMDW и работают на многих языках.

  • Поиск по корпоративным документам
  • RAG для чат-ботов и ассистентов
  • Поиск по картинкам и страницам (VL-версии)
Размеры
1B – 8B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Роботы2025–2026

NVIDIA Cosmos

NVIDIA · США

Модели «мира» для роботов и беспилотников: генерируют реалистичное видео физических сцен и предсказывают действия. Cosmos 3 объединяет понимание, генерацию и управление.

  • Синтетические видео для обучения роботов и беспилотников
  • Проверка сценариев в симуляции
  • Управление роботом (Policy-версии)
Размеры
2B – 65B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Роботы2026

LingBot-VLA

Ant Group (Robbyant) · Китай

Модель управления роботами от Ant Group, обученная на большом объёме данных с реальных роботов. Версия 2.0 работает с разными типами манипуляторов.

  • Управление двуруким манипулятором
  • Дообучение под свою операцию
  • Пилоты сборки и сортировки
Размеры
4B – 6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Роботы2026

Xiaomi Robotics

Xiaomi · Китай

Открытые модели управления роботами от Xiaomi. Robotics-1 рассчитана на бытовые и кухонные задачи, U0 объединяет понимание сцены и действия.

  • Управление манипулятором по команде
  • Бытовые и сервисные сценарии
  • Основа для дообучения
Размеры
4B – 5B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Речь в текст2024–2026

GigaAM

Сбер · Россия

Модели Сбера для распознавания русской речи, одни из самых точных для русского языка. Есть распознавание эмоций, версия v3 с пунктуацией и многоязычная версия (русский, казахский, киргизский, узбекский).

  • Расшифровка звонков на русском
  • Протоколы совещаний
  • Голосовое управление сервисами
Размеры
220M – 600M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2025–2026

Kimi

Moonshot AI · Китай

Сверхкрупные MoE-модели Moonshot для агентной работы. K3 на 2,8 трлн параметров — самая большая открытая модель на момент выхода, с контекстом до 1 млн токенов и пониманием картинок.

  • Многошаговые агенты: поиск, сбор данных, отчёты
  • Глубокий анализ документов
  • Помощь программистам
Размеры
16B-A3B – 2.8T-A104B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Текст2025–2026

LongCat

Meituan · Китай

Модели Meituan (крупнейший сервис доставки Китая). LongCat-Flash динамически меняет объём вычислений под сложность запроса; LongCat-2.0 — 1,6 трлн параметров под MIT.

  • Агенты для заказов и сервисных процессов
  • Корпоративный ассистент
  • Разбор длинных документов
Размеры
69B – 1.6T-A48B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Текст2024–2026

EXAONE

LG AI Research · Южная Корея

Корейско-английские модели LG. Большая часть линии некоммерческая, но флагман K-EXAONE 2.0 на 750 млрд параметров вышел под Apache 2.0.

  • Корпоративный ассистент
  • Работа с корейскими и английскими текстами
  • Разбор документов и картинок (4.5)
Размеры
1.2B – 750B-A37B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Текст2023–2026

Solar

Upstage · Южная Корея

Модели корейской Upstage. Solar Open 2 рассчитана на офисную работу с документами: 250 млрд параметров, из них активны 15 млрд, языки — английский, корейский, японский.

  • Работа с офисными документами
  • Агенты для рутинных задач
  • Помощь программистам
Размеры
10.7B – 250B-A15B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Текст2025–2026

Kanana

Kakao · Южная Корея

Компактные корейско-английские модели Kakao. Kanana 2 30B-A3B работает быстро за счёт MoE, малые версии на 1–3B подходят для обычного ПК.

  • Чат-бот поддержки
  • Классификация обращений
  • Лёгкий ассистент на своём ПК
Размеры
1.3B – 30B-A3B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Текст2025–2026

Apertus

Swiss AI (ETH Zurich, EPFL, CSCS) · Швейцария

Государственная открытая модель Швейцарии: открыты веса, данные и рецепт, более 1000 языков в обучении. Версия 1.5 понимает изображения.

  • Многоязычный ассистент
  • Ответы по документам
  • Разбор изображений и сканов (v1.5)
Размеры
0.5B – 70B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2026

Inkling

Thinking Machines Lab · США

Флагманские открытые модели лаборатории Миры Мурати: принимают текст, изображения и аудио. Большие MoE, требуют нескольких видеокарт.

  • Корпоративный ассистент уровня флагмана
  • Разбор документов, изображений и аудио
  • Помощь в программировании
Размеры
276B-A12B, 975B-A41B
Железо
от: Кластер
Можно в коммерциюПодробнее
Код2026

Laguna

Poolside · США

Модели для агентного программирования: самостоятельно правят код в репозитории. Младшая XS запускается на Mac с 36 ГБ памяти, у S 2.1 контекст 1M токенов.

  • Агент-программист для внутренней разработки
  • Исправление ошибок и доработка кода
  • Работа с большими кодовыми базами
Размеры
33B-A3B – 225B-A23B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Картинка + текст2024–2026

Ovis

Alibaba (AIDC-AI) · Китай

Модели зрения от международного подразделения Alibaba с сильным чтением текста и таблиц. В линейке есть MoE Ovis2.6 и отдельные компактные OvisOCR для документов.

  • Извлечение данных из счетов, договоров и накладных
  • Распознавание таблиц
  • Ответы на вопросы по фото и графикам
Размеры
0.9B – 80B-A3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCR2025–2026

HunyuanOCR

Tencent · Китай

Лёгкая OCR-модель Tencent: разбор документов, поиск текста на фото, извлечение полей и перевод текста с картинок. Версия 1.5 быстрее и запускается на обычном ПК.

  • Извлечение полей из счетов и накладных
  • Распознавание таблиц и формул
  • Перевод текста на фотографиях и сканах
Размеры
1B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Код2025–2026

Mellum

JetBrains · Чехия

Модели JetBrains для быстрого автодополнения кода. Mellum2 (12B, активны 2.5B) уже полноценный помощник: пишет и правит код, вызывает инструменты, рассуждает.

  • Быстрое автодополнение кода на своём сервере
  • Помощник разработчика без отправки кода в облако
  • Дообучение на коде компании
Размеры
4B – 12B-A2.5B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинки2026

Krea 2

Krea · США

Модель картинок на 12B с упором на реализм без глянцевого «ИИ-вида». Turbo-версия выдаёт 2K-картинку за пару секунд.

  • Реалистичные фото для рекламы
  • Картинки высокого разрешения
  • Дообучение стилей
Размеры
12B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Картинки2026

Ideogram 4

Ideogram · Канада

Открытые веса модели Ideogram, известной точной типографикой. Под некоммерческой лицензией: для бизнеса подходит только для тестов.

  • Тестирование генерации с текстом
  • Исследования и прототипы
Размеры
около 9B
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Математика и рассуждения2025–2026

OpenThinker

Open Thoughts (Стэнфорд, Беркли и другие университеты) · США

Полностью открытые рассуждающие модели: выложены и веса, и обучающие данные. Новые версии OpenThinkerAgent умеют выполнять многошаговые задачи.

  • Расчёты и проверка формул
  • Сложная аналитика с пошаговым разбором
  • Проверка логики регламентов
Размеры
1.5B – 32B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Компьютерное зрение2025–2026

RF-DETR

Roboflow · США

Детектор объектов в реальном времени, открытая замена YOLO без AGPL. Умеет сегментацию (контуры объектов), с 2026 года — ключевые точки.

  • Детекция объектов на видео и фото
  • Точные контуры деталей и дефектов
  • Дообучение под свои классы объектов
Размеры
Nano – 2XL
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Прогнозы2025–2026

TiRex

NXAI · Австрия

Компактная модель прогнозов на архитектуре xLSTM, лидер открытых тестов при малом размере. Быстро работает на обычном процессоре.

  • Прогноз спроса и продаж
  • Прогноз потребления энергии
  • Прогнозы на слабом железе и на месте
Размеры
около 35M – 82M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текст2026

Qwen3-ASR

Alibaba (Qwen) · Китай

Модели распознавания речи от команды Qwen на 50+ языков, включая русский. Хорошо справляются с шумом, пением и акцентами.

  • Расшифровка звонков и встреч
  • Субтитры к видео
  • Распознавание на нескольких языках
Размеры
0.6B – 1.7B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текст2026

Cohere Transcribe

Cohere · Канада

Модель распознавания речи от Cohere на 14 языков (русского в списке нет), отдельная версия для арабского. Рассчитана на точную расшифровку деловых записей.

  • Расшифровка встреч и интервью
  • Субтитры
  • Поиск по аудиоархиву
Размеры
2B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речи2025–2026

Higgs Audio

Boson AI · США

Выразительный синтез речи и диалогов с клонированием голоса, плюс модели распознавания. Третья версия синтеза поддерживает около 100 языков, включая русский, но некоммерческая.

  • Выразительная озвучка роликов
  • Озвучка диалогов
  • Клонирование голоса
Размеры
около 3B – 8B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Синтез речи2025–2026

Zonos

Zyphra · США

Синтез речи с клонированием голоса и тонкой настройкой эмоций, скорости и высоты голоса.

  • Клонирование голоса
  • Эмоциональная озвучка
  • Озвучка роликов
Размеры
около 1.6B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Музыка и звук2025–2026

ACE-Step

ACE Studio и StepFun · Китай

Быстрая генерация песен с вокалом на 19 языках, включая русский: полная песня за секунды, правка отдельных фрагментов и смена стиля.

  • Песни и джинглы для рекламы
  • Фоновая музыка для роликов
  • Демо-версии композиций
Размеры
около 2B – 4B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2025–2026

MiniMax

MiniMax · Китай

Крупные MoE-модели с очень длинным контекстом (до 1 млн токенов у Text-01 и M3). M3 — мультимодальная, понимает картинки. Лицензии сильно различаются от версии к версии.

  • Анализ больших архивов документов за один запрос
  • Агенты с инструментами
  • Помощь программистам
Размеры
230B-A10B – 456B-A46B
Железо
от: Кластер
Коммерция с условиямиПодробнее
Модерация и безопасность2024–2026

GLiNER-PII

Сообщество GLiNER (Fastino, Knowledgator, NVIDIA и др.) · США

Маленькие модели на основе GLiNER для поиска персональных данных: паспортов, телефонов, счетов, адресов. Типы данных задаются словами. Русский официально не заявлен.

  • Маскирование персональных данных перед облачным ИИ
  • Поиск паспортных данных и реквизитов в документах
  • Проверка выгрузок на утечки
Размеры
около 200M – 500M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текст2024–2026

Moondream

Moondream (M87 Labs) · США

Небольшая и быстрая модель зрения для продуктовых задач: ответы на вопросы, поиск и указание объектов, подписи. Moondream 3.1 — MoE на 9B с 2B активных.

  • Поиск объектов и подсчёт на фото
  • Проверка фото из полевых отчётов
  • Подписи и теги для каталога
Размеры
2B – 9B-A2B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Картинки2025–2026

HiDream

HiDream.ai · Китай

Открытые модели картинок под MIT: генерация (I1), редактирование по инструкции (E1) и единая модель O1-Image, которая делает и то и другое.

  • Генерация картинок по описанию
  • Правка изображений словами
  • Вариации продуктовых фото
Размеры
около 9B – 17B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Аватары2025–2026

LongCat-Video-Avatar

Meituan · Китай

Говорящие люди по аудио на базе LongCat-Video. Версия 1.5 доведена до продакшна: стабильные длинные ролики на китайском и английском.

  • Видео с ведущим новостей или курса
  • Промо-ролики с говорящим персонажем
  • Пение и озвучка
Размеры
на базе LongCat-Video 13.6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Медицина2023–2026

Meditron

EPFL · Швейцария

Открытые медицинские модели швейцарского EPFL, которые дообучают поверх разных базовых моделей по клиническим руководствам. Не заменяет врача, решения принимает специалист.

  • Ответы персоналу по клиническим руководствам
  • Черновики выписок для проверки врачом
  • Поиск по медицинской литературе
Размеры
2B – 70B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
3D2024–2026

TripoSR / TripoSG

VAST (TripoSR — вместе со Stability AI) · Китай

Семейство VAST: 3D-модель по одной фотографии. TripoSR работает меньше секунды, TripoSG даёт более чистую геометрию, TripoSplat строит сцену из гауссовых точек.

  • 3D-модель товара по фото
  • Заготовки объектов для игр и AR
  • Быстрый 3D-прототип для печати
Размеры
до 1.5B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Поиск и RAG2023–2026

Jina Embeddings

Jina AI · Германия

Сильные многоязычные эмбеддинги с длинным контекстом, v5-omni понимает текст, картинки и аудио. Свежие версии открыты только для некоммерческого использования.

  • Поиск по документам на многих языках
  • Поиск по картинкам и сканам
  • Классификация и кластеризация
Размеры
33M – 3.8B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Роботы2025–2026

MolmoAct

Ai2 (Allen Institute for AI) · США

Полностью открытая модель управления роботом, которая сначала «рассуждает» о пространстве и траектории, а потом действует. Ход рассуждений можно проверить.

  • Управление манипулятором с объяснимыми шагами
  • Дообучение под свой робот
  • Исследовательские пилоты
Размеры
5B – 8B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Текст2023–2026

Dolphin

Cognitive Computations (Эрик Хартфорд) · США

Дообучения без встроенной цензуры поверх Llama, Mistral, Qwen и других: модель выполняет почти любые запросы. Ответственность за фильтрацию и модерацию полностью на том, кто её внедряет, — без своего фильтра клиентам её не показывать.

  • Ассистент, который не отказывает в законных, но «острых» темах
  • Внутренние инструменты под жёстким системным промптом
  • Ролевые и творческие сценарии
Размеры
0.5B – 405B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Речь в текст2023–2026

NVIDIA Parakeet / Canary / Nemotron Speech

NVIDIA · США

Быстрые модели распознавания речи от NVIDIA, в том числе потоковые для работы в реальном времени. Parakeet TDT v3 и Nemotron 3.5 ASR понимают русский.

  • Расшифровка звонков и совещаний
  • Субтитры к видео
  • Голосовой ввод в реальном времени
Размеры
110M – 2.5B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Синтез речи2025–2026

Chatterbox

Resemble AI · США

Синтез речи с клонированием голоса и настройкой эмоциональности. Многоязычная версия поддерживает 23 языка, включая русский; Turbo и Flash ускорены для живого диалога.

  • Голос для бота и ассистента
  • Клонирование фирменного голоса
  • Озвучка роликов
Размеры
около 350M – 500M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речи2025–2026

MOSS-TTS / MOSS-TTSD

OpenMOSS (Фуданьский университет) · Китай

Семейство синтеза речи: озвучка диалогов на несколько голосов (TTSD), быстрый синтез для живого общения и крошечная Nano. Версия 1.5 поддерживает 30+ языков, включая русский.

  • Озвучка подкастов и диалогов
  • Голос для ассистента
  • Клонирование голоса
Размеры
100M – 8.5B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Музыка и звук2024–2026

Stable Audio

Stability AI · Великобритания

Генерация коротких музыкальных фрагментов и звуковых эффектов по описанию. Третья версия разделена на модели для музыки и для звуков.

  • Звуковые эффекты для роликов и игр
  • Фоновая музыка и джинглы
  • Звуки для интерфейсов
Размеры
около 0.5B – 2.3B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Текст2025–2026

Step

StepFun · Китай

MoE-модели StepFun, рассчитанные на быструю и дешёвую работу: при 196 млрд параметров Step-3.5/3.7-Flash задействуют около 11 млрд на токен. Step-3.7-Flash понимает картинки.

  • Агенты с высокой нагрузкой
  • Разбор документов со схемами и скриншотами
  • Помощь программистам
Размеры
196B-A11B – 321B
Железо
от: Кластер
Можно в коммерциюПодробнее
Текст2024–2026

Cohere Command

Cohere · Канада

Модели для бизнеса: поиск по документам со ссылками на источники, вызов инструментов, много языков. Command A+ 2026 года впервые вышла под Apache 2.0.

  • Ответы по базе знаний со ссылками на источники
  • Агенты, работающие с внутренними системами
  • Перевод и переписка на разных языках
Размеры
7B – 218B-A25B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Перевод2025–2026

Hunyuan-MT / Hy-MT

Tencent · Китай

Переводчики Tencent на 33 языка, первая версия победила на соревновании WMT25. Русский есть. Малая версия 1.8B работает на ноутбуке, свежая Hy-MT2 под Apache 2.0.

  • Перевод документов с сохранением форматирования
  • Перевод с заданным глоссарием терминов
  • Перевод переписки с китайскими партнёрами
Размеры
1.8B – 30B-A3B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Модерация и безопасность2024–2026

Aegis / Nemotron Safety Guard

NVIDIA · США

Фильтры контента NVIDIA для ботов, с отдельными моделями для контроля темы разговора и поиска взлома. Safety Guard v3 обучена на 9 языках, русский проверяли только без дообучения.

  • Проверка запросов и ответов бота
  • Удержание бота в рамках своей темы
  • Поиск попыток обойти правила
Размеры
4B – 8B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Обработка фото2023–2026

BRIA RMBG

BRIA AI · Израиль

Удаление фона от BRIA, обучено на лицензированных фото. Мягкие края, волосы, прозрачность. Есть версии для видео. Для бизнеса нужен платный договор.

  • Вырезка товара на белый фон
  • Фото сотрудников и экспертов без фона
  • Удаление фона на видео
Размеры
44M – 220M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Картинка + текст2023–2026

LLaVA

LLaVA / LMMs-Lab (исследователи из США и Китая) · США / Китай

Открытый проект, с которого пошла мода на модели «картинка + текст». Линейка OneVision понимает фото, документы и видео; открыты данные и рецепты обучения.

  • Ответы на вопросы по фото и скриншотам
  • Описание товаров по фотографии
  • Разбор видео по кадрам
Размеры
0.5B – 72B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текст2024–2026

MiniCPM-V

OpenBMB (ModelBest и Университет Цинхуа) · Китай

Компактные модели зрения, которые работают даже на телефоне и ноутбуке. Хорошо читают текст на фото, понимают видео; версия 4.6 весит всего 1.3B.

  • Распознавание текста на фото прямо на устройстве
  • Разбор чеков и документов без отправки в облако
  • Описание фото и видео
Размеры
1.3B – 8B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текст2025–2026

Keye-VL

Kuaishou · Китай

Модели зрения от Kuaishou с упором на короткие видео. Keye-VL-2.0 (30B, активны 3B) хорошо понимает, что и когда происходит в ролике.

  • Разбор и описание коротких видео
  • Проверка роликов и контента
  • Поиск нужного момента в видео
Размеры
8B – 671B-A37B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCR2025–2026

PaddleOCR-VL

Baidu (PaddlePaddle) · Китай

Компактная модель для разбора документов из популярного набора PaddleOCR. По карточке поддерживает 109 языков, в том числе русский; версия 1.6 лидирует на тесте OmniDocBench.

  • Распознавание счетов, договоров и накладных, в том числе на русском
  • Распознавание таблиц, формул, печатей
  • Перевод сканов в Markdown и JSON
Размеры
0.9B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCR2025–2026

MinerU

Shanghai AI Laboratory (OpenDataLab) · Китай

Популярный открытый инструмент перевода PDF в Markdown со своей небольшой моделью. MinerU2.5-Pro улучшили только за счёт данных, без роста размера. Языки в карточке — китайский и английский.

  • Перевод PDF-отчётов и договоров в Markdown
  • Распознавание таблиц и формул
  • Подготовка документов для RAG и поиска
Размеры
0.9B – 1.2B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2024–2026

Gemma

Google · США

Компактные модели Google: хорошо работают на одном компьютере, старшие версии понимают картинки.

  • Ассистент на ноутбуке без интернета
  • Разбор фото документов и чеков
  • Классификация обращений
Размеры
270M – 31B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Аватары2024–2026

Hallo

Фуданьский университет · Китай

Серия говорящих портретов по аудио: от коротких клипов до часовых видео в 4K. Hallo-Live рассчитана на работу в реальном времени.

  • Видео с ведущим по фото и аудио
  • Длинные обучающие ролики
  • Живой аватар
Размеры
около 1B – 5B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
3D2025–2026

HY-World (HunyuanWorld)

Tencent · Китай

Генерация целых 3D-миров и сцен по тексту или картинке, по которым можно ходить. Вторая версия собирает сцену из видео и фото.

  • 3D-сцены для игр и виртуальных туров
  • Фоны и окружение для видеопродакшна
  • Черновики локаций для симуляций
Размеры
набор из нескольких моделей
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Поиск и RAG2024–2026

Granite Embedding

IBM · США

Лёгкие эмбеддинги IBM для корпоративного поиска, обученные на данных с понятными правами. R2 2026 года стали многоязычными.

  • Поиск по корпоративным документам
  • RAG на обычном сервере без видеокарты
  • Переранжирование результатов
Размеры
30M – 311M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Прогнозы2025–2026

Toto

Datadog · США

Модель прогнозов от Datadog, обученная на метриках серверов и приложений. Особенно сильна для IT-мониторинга: нагрузка, задержки, ошибки.

  • Прогноз нагрузки на серверы
  • Поиск аномалий в метриках
  • Планирование мощностей
Размеры
4M – 2.5B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речи2025–2026

VoxCPM

OpenBMB (ModelBest, Университет Цинхуа) · Китай

Синтез речи с клонированием голоса и естественной интонацией. VoxCPM2 поддерживает 30 языков, включая русский.

  • Клонирование голоса
  • Озвучка роликов и аудиокниг
  • Голос для ассистента
Размеры
0.5B – 2.3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2025–2026

Arcee Trinity

Arcee AI · США

Американское семейство MoE-моделей, обученных с нуля: Nano, Mini и Large. Trinity-Large-Thinking на 398B рассуждает перед ответом.

  • Агенты с вызовом инструментов
  • Задачи с рассуждением
  • Корпоративный ассистент на своих серверах
Размеры
6B – 398B-A13B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Перевод2020–2026

OPUS-MT (MarianMT)

Helsinki-NLP, Хельсинкский университет · Финляндия

Более тысячи маленьких переводчиков, каждый под свою пару языков. Есть русский-английский и обратно. Работают быстро даже на обычном процессоре.

  • Массовый перевод коротких текстов
  • Перевод прямо на сервере без видеокарты
  • Перевод отзывов и заявок перед анализом
Размеры
25M – 240M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Модерация и безопасность2024–2026

Granite Guardian

IBM · США

Модели-судьи IBM: ловят вред, мат, попытки взлома, а в RAG и агентах проверяют, опирается ли ответ на документы. Можно задать своё правило словами.

  • Проверка запросов и ответов бота
  • Поиск выдуманных фактов в ответах по базе знаний
  • Проверка своих правил, заданных текстом
Размеры
38M – 8B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Модерация и безопасность2026

OpenAI Privacy Filter

OpenAI · США

Находит и скрывает персональные данные: имена, адреса, телефоны, почту, номера счетов, пароли. Работает даже в браузере. Обучена в основном на английском.

  • Очистка текста от персональных данных перед отправкой в облачный ИИ
  • Поиск паролей и ключей в текстах
  • Обезличивание переписки для аналитики
Размеры
1.5B (50M активных)
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текст2025–2026

Granite Vision

IBM · США

Компактные модели IBM для корпоративных документов: таблицы, графики, формы, пары «поле — значение». Карточка честно предупреждает, что лучше всего работает с английским.

  • Извлечение полей из форм и счетов
  • Перевод графиков и таблиц в данные
  • Ответы на вопросы по документам
Размеры
2B – 4B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2023–2026

Mistral

Mistral AI · Франция

Европейские модели с упором на скорость. Mixtral — одна из первых открытых моделей на архитектуре «смесь экспертов».

  • Быстрые ответы в чате
  • Извлечение данных из текста
  • Перевод и работа с несколькими языками
Размеры
3B – 675B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Компьютерное зрение2023–2026

Segment Anything (SAM)

Meta · США

Выделяет любой объект на фото и видео по клику или рамке. Основа для удаления фона и подсчёта объектов.

  • Удаление фона с фото товара
  • Подсчёт объектов на фото
  • Разметка данных для обучения
Размеры
91M – ~0,85B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Медицина2025–2026

Hulu-Med

Чжэцзянский университет · Китай

Медицинская модель для текста, снимков, 3D-исследований и видео: от лёгкой 4B до крупной MoE. Не заменяет врача, решения принимает специалист.

  • Подсказки при разборе снимков и КТ для врача
  • Черновики заключений и выписок
  • Поиск по медицинской литературе
Размеры
4B – 235B-A22B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Математика и рассуждения2025–2026

Goedel-Prover

Принстонский университет · США

Открытые модели для формальных доказательств в Lean 4 из Принстона. Свежая Goedel-Code-Prover доказывает корректность программ.

  • Формальная проверка математических выкладок
  • Проверка корректности кода
  • Обучение
Размеры
7B – 32B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Поиск и RAG2026

pplx-embed

Perplexity · США

Эмбеддинги поискового сервиса Perplexity. Есть версии, которые учитывают контекст всего документа, а не только отдельного фрагмента.

  • Поиск по большим массивам документов
  • RAG с учётом контекста документа
  • Поиск по сайту и каталогу
Размеры
0.6B – 4B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Роботы2025–2026

NVIDIA Isaac GR00T

NVIDIA · США

Базовая модель NVIDIA для человекоподобных роботов и манипуляторов: видит, понимает команду и выдаёт движения. Встроена в экосистему Isaac.

  • Управление человекоподобными роботами
  • Дообучение под свою роботизированную ячейку
  • Обучение в симуляции с переносом на реального робота
Размеры
2B – 3B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Речь в текст2025–2026

Voxtral

Mistral AI · Франция

Речевые модели Mistral: понимают аудио, расшифровывают и отвечают на вопросы по записи. Realtime-версия распознаёт в реальном времени и поддерживает русский; есть синтез речи.

  • Расшифровка и краткое содержание записей
  • Вопросы к аудио
  • Распознавание в реальном времени
Размеры
3B – 24B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Синтез речи2024–2026

Fish Speech / OpenAudio

Fish Audio · США / Китай

Синтез речи с клонированием голоса и управлением эмоциями на 80+ языках, включая русский. Качество близко к платным сервисам, но веса только для исследований.

  • Клонирование голоса
  • Эмоциональная озвучка
  • Озвучка на многих языках
Размеры
0.5B – около 4.5B
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Текст2024–2026

Sarvam

Sarvam AI · Индия

Индийские модели с упором на 22 языка Индии. Sarvam 30B и 105B 2026 года это MoE-модели с сильными навыками рассуждения и работы в агентах.

  • Многоязычная поддержка клиентов
  • Задачи с рассуждением и расчётами
  • Агенты с вызовом инструментов
Размеры
2B – 105B-A10B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2025–2026

Reka Flash и Reka Edge

Reka AI · США

Компактные модели Reka: Flash 3 на 21B для рассуждений и Reka Edge на 7B, которая быстро разбирает изображения и видео на устройстве.

  • Разбор фото и видео (Edge)
  • Поиск объектов на изображениях
  • Задачи с рассуждением (Flash)
Размеры
7B – 21B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Картинка + текст2023–2026

InternVL

Shanghai AI Laboratory (OpenGVLab) · Китай

Большая линейка китайских моделей зрения с размерами от 1B до 241B. InternVL-U (4B) объединяет понимание картинок, их генерацию и редактирование.

  • Понимание документов, схем и графиков
  • Ответы на вопросы по фото
  • Разбор видео
Размеры
1B – 241B-A28B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текст2024–2026

Molmo

Ai2 (Allen Institute for AI) · США

Полностью открытые модели зрения Ai2 (веса и данные). Умеют указывать точку на картинке и считать предметы; Molmo2 понимает видео, MolmoWeb управляет браузером.

  • Подсчёт товаров и объектов на фото
  • Указание, где на снимке нужный предмет
  • Разбор видео
Размеры
1B-A7B – 72B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCR2025–2026

dots.ocr

rednote hilab (Xiaohongshu) · Китай

Многоязычная модель для разбора документов: текст, таблицы, формулы и порядок чтения за один проход. dots.mocr ещё переводит графики и схемы в векторный SVG.

  • Распознавание счетов, договоров и накладных
  • Перевод таблиц в редактируемый вид
  • Перевод графиков и схем в векторный формат
Размеры
около 3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCR2025–2026

Chandra OCR

Datalab · США

Сильная OCR-модель от авторов Marker и Surya: рукописный текст, формы, таблицы. По карточке поддерживает 90+ языков, русский есть среди примеров.

  • Распознавание счетов, договоров и накладных, в том числе на русском
  • Распознавание рукописных форм и анкет
  • Распознавание сложных таблиц
Размеры
5B – 9B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Документы и OCR2026

Qianfan-OCR

Baidu (Qianfan) · Китай

Модель Baidu, которая не только распознаёт документ, но и отвечает на вопросы по нему. По карточке поддерживает 192 языка, включая кириллицу.

  • Распознавание счетов, договоров и накладных, в том числе на русском
  • Разметка страницы и распознавание таблиц
  • Ответы на вопросы по документу
Размеры
4B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Код2024–2026

Qwen Coder

Alibaba (команда Qwen) · Китай

Самая широкая открытая линейка для кода: от 0.5B для автодополнения до 480B для агентов. Qwen3-Coder-Next (80B, активны 3B) работает как агент-разработчик на одной видеокарте.

  • Автодополнение кода в редакторе
  • Агент, который сам правит код в репозитории
  • Генерация и доработка скриптов, SQL, интеграций
Размеры
0.5B – 480B-A35B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Код2026

IQuest-Coder

IQuest Research · Китай

Семейство моделей для кода с обычными и рассуждающими версиями, в том числе вариант Loop с повторным проходом по слоям. Размеры от 7B до 40B.

  • Генерация и доработка кода
  • Решение задач с пошаговыми рассуждениями
  • Агентная работа с репозиторием
Размеры
7B – 40B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Код2026

SERA (Ai2 Open Coding Agents)

Ai2 (Allen Institute for AI) · США

Полностью открытые агенты-разработчики от Ai2: открыты веса, данные и рецепт обучения. Задуманы так, чтобы компания могла дешево доучить агента на своём репозитории.

  • Агент для исправления задач в коде
  • Дообучение агента под внутренний репозиторий
  • Автоматизация мелких правок и тестов
Размеры
8B – 32B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинки2025–2026

LongCat-Image

Meituan · Китай

Модель генерации и редактирования картинок на 6B от Meituan. Хорошо пишет китайский текст, есть быстрая версия для правок.

  • Генерация картинок по описанию
  • Правка фото по инструкции
  • Визуалы для карточек товаров
Размеры
6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Математика и рассуждения2026

QED-Nano

LM Provers (CMU, Hugging Face, ETH Zurich, Project Numina) · США, Швейцария, Франция

Маленькая модель 4B на Qwen3, которая пишет математические доказательства на обычном языке почти на уровне больших моделей. Запускается на ноутбуке.

  • Проверка логики рассуждений и выкладок
  • Пошаговое объяснение решений
  • Обучение и олимпиадная подготовка
Размеры
4B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голосовые ассистенты2024–2026

Moshi / Hibiki

Kyutai · Франция

Голосовой ассистент, который слушает и говорит одновременно, без задержки на распознавание и синтез. Hibiki — синхронный перевод речи в речь между несколькими европейскими языками.

  • Голосовой собеседник в реальном времени
  • Синхронный перевод речи
  • Голосовые интерфейсы без задержки
Размеры
2B – 7B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Голосовые ассистенты2025–2026

MiniCPM-o

OpenBMB (ModelBest, Университет Цинхуа) · Китай

Небольшая модель, которая видит, слышит и отвечает голосом в реальном времени, может клонировать голос. Голосовой диалог на английском и китайском, текст — на 30+ языках.

  • Голосовой ассистент на своём сервере
  • Разбор видео и документов
  • Ответы голосом по картинке с камеры
Размеры
8B – 9B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Примерка одежды2026

FASHN VTON

FASHN AI · Израиль

Редкая открытая примерка с коммерческой лицензией: без маски, берёт фото вещи на модели или раскладку. Веса около 2 ГБ.

  • Карточки товара на модели без фотосессии
  • Примерочная на сайте магазина
  • Каталог из фото раскладки одежды
Размеры
972M
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Картинки2024–2026

FLUX

Black Forest Labs · Германия

Генерация картинок от авторов Stable Diffusion. Хорошо рисует текст на изображении и держит композицию.

  • Картинки для карточек товаров
  • Баннеры и обложки
  • Редактирование фото по описанию (Kontext)
Размеры
4B – 32B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Картинки2024–2026

Hunyuan Image

Tencent · Китай

Модели картинок Tencent. HunyuanImage 3.0 — крупнейшая открытая MoE-модель генерации на 80B, умеет рассуждать над запросом и редактировать по инструкции.

  • Сложные сцены по длинному описанию
  • Картинки с текстом на китайском и английском
  • Редактирование изображений по инструкции
Размеры
1.5B – 80B-A13B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Картинки2025–2026

Z-Image

Alibaba (Tongyi-MAI) · Китай

Компактная модель на 6B с фотореализмом уровня крупных моделей. Turbo-версия выдаёт картинку за несколько шагов на обычной игровой видеокарте.

  • Фотореалистичные рекламные картинки
  • Картинки с текстом на русском, английском и китайском
  • Массовая генерация визуалов
Размеры
6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Картинки2026

GLM-Image

Zhipu AI (Z.ai) · Китай

Гибрид языковой модели на 9B и декодера на 7B. Сильна в картинках с большим количеством текста: постеры, инфографика, слайды.

  • Постеры и баннеры с текстом
  • Инфографика
  • Иллюстрации к презентациям
Размеры
9B + 7B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Видео2025–2026

SkyReels

Skywork AI (Kunlun Tech) · Китай

Видеомодели для кинематографичных сцен с людьми. Умеют ролики неограниченной длины, продление видео и говорящих персонажей по аудио.

  • Длинные ролики с продолжением
  • Видео с одним персонажем по референсу
  • Говорящий аватар по голосу
Размеры
1.3B – 19B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Аватары2024–2026

EchoMimic

Ant Group · Китай

Говорящие аватары от Ant Group: лицо, а с V2 и жесты рук. V3-Flash выдаёт видео за 8 шагов и укладывается в 12 ГБ видеопамяти.

  • Видео с ведущим по фото и голосу
  • Аватар с жестами для презентаций
  • Озвученные персонажи
Размеры
до 1.3B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Аватары2025–2026

Live Avatar

Alibaba (Quark) · Китай

Потоковый аватар в реальном времени неограниченной длины. Подходит для живых эфиров и диалога, но требует мощного серверного железа.

  • Живой аватар для диалога с клиентом
  • Бесконечные трансляции с ведущим
  • Интерактивные персонажи
Размеры
14B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Медицина2025–2026

MedGemma

Google · США

Медицинская версия Gemma от Google: читает медицинские тексты и снимки (рентген, дерматология, гистология). Инструмент для врача и разработчика, не заменяет врача, решения принимает специалист.

  • Черновики выписок и заключений для проверки врачом
  • Подсказки при разборе снимков для врача
  • Поиск и пересказ медицинской литературы
Размеры
4B – 27B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Медицина2023–2026

CheXagent / CheXOne

Stanford AIMI · США

Стэнфордские модели для рентгена грудной клетки: описывают снимок и готовят черновик заключения. Не заменяет врача, решения принимает специалист.

  • Черновик описания рентгенограммы для врача-рентгенолога
  • Подсказки при разборе снимков для врача
  • Проверка полноты заключений
Размеры
3B – 8B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Медицина2025–2026

Lingshu

Alibaba DAMO Academy · Китай

Медицинская модель Alibaba на основе Qwen2.5-VL: понимает снимки разных типов и медицинский текст, умеет рассуждать по шагам. Не заменяет врача, решения принимает специалист.

  • Подсказки при разборе снимков для врача
  • Черновики заключений и выписок
  • Поиск по медицинской литературе
Размеры
7B – 32B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Медицина2025–2026

AntAngelMed

Ant Healthcare (Ant Group) и Центр медицинской информации провинции Чжэцзян · Китай

Крупная медицинская MoE-модель на базе Ling-flash-2.0: 100B параметров, из них в работе 6B, поэтому отвечает быстро. Не заменяет врача, решения принимает специалист.

  • Справочные ответы персоналу по клиническим вопросам
  • Черновики выписок для проверки врачом
  • Поиск по медицинской литературе
Размеры
100B-A6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Компьютерное зрение2023–2026

YOLO (Ultralytics)

Ultralytics · США

Самый распространённый детектор объектов в реальном времени: находит и выделяет предметы на видео даже на слабом железе. YOLOv5 вышел ещё в 2020, в каталоге отсчёт от YOLOv8.

  • Подсчёт людей, машин, товаров на видео
  • Контроль касок и спецодежды
  • Поиск брака на конвейере
Размеры
2.4M – 68M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Поиск и RAG2025–2026

Qwen3 Embedding / Reranker

Alibaba (Qwen) · Китай

Эмбеддинги и реранкеры на базе Qwen3, в числе лучших открытых для многоязычного поиска, включая русский. VL-версии ищут по картинкам, скриншотам и видео.

  • Поиск по базе знаний для RAG
  • Переранжирование найденного перед ответом
  • Поиск по сканам, слайдам и скриншотам
Размеры
0.6B – 8B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Поиск и RAG2026

Voyage 4 nano

Voyage AI (MongoDB) · США

Единственная открытая модель линейки Voyage 4: её векторы совместимы с платными старшими версиями, можно начать локально и позже перейти на API.

  • Поиск по документам на своём сервере
  • RAG для небольших баз знаний
  • Поиск похожих текстов
Размеры
около 340M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речи2026

Qwen3-TTS

Alibaba (Qwen) · Китай

Синтез речи на 10 языках, включая русский: клонирование голоса по 3 секундам, готовые голоса и создание голоса по текстовому описанию.

  • Голос для бота и ассистента
  • Клонирование фирменного голоса
  • Подбор голоса по описанию
Размеры
0.6B – 1.7B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2023–2026

Baichuan

Baichuan Intelligence · Китай

Сначала универсальные китайские модели, с 2025 года — медицинская линия. Baichuan-M3 (на основе Qwen3-235B) обучена моделировать ход клинического рассуждения врача.

  • Справочный помощник врача
  • Предварительный опрос пациента
  • Разбор медицинских документов
Размеры
7B – 235B-A22B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Текст2023–2026

Falcon

Technology Innovation Institute (TII) · ОАЭ

Семейство из Абу-Даби: от ранних Falcon 40B и 180B до гибридных Falcon-H1 и сверхмалых Falcon-H1-Tiny на 90–600M параметров для устройств.

  • Ассистент и ответы по документам
  • Работа на слабом железе и в устройствах
  • Вызов инструментов в простых агентах
Размеры
90M – 180B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Текст2023–2026

Phi

Microsoft · США

Малые модели Microsoft, обученные на тщательно отобранных данных: сильны в логике и математике при скромном размере. Есть версии с картинками и речью.

  • Ассистент на ноутбуке или своём сервере
  • Задачи с рассуждением и расчётами
  • Разбор изображений и схем (vision-версии)
Размеры
1.3B – 42B-A6.6B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2024–2026

OLMo

Allen Institute for AI (Ai2) · США

Полностью открытые модели: опубликованы не только веса, но и данные, код обучения и промежуточные снимки. Удобно, когда важна прозрачность происхождения.

  • Ассистент и ответы по документам
  • Задачи с рассуждением (версии Think)
  • Дообучение под свои данные с понятной историей модели
Размеры
1B – 32B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2024–2026

Jamba

AI21 Labs · Израиль

Гибрид трансформера и Mamba с окном до 256K токенов: держит длинные документы быстрее обычных моделей. Jamba2 ориентирована на точные ответы по источникам.

  • Ответы по длинным регламентам и договорам
  • Поиск по базе знаний (RAG)
  • Пересказ больших документов
Размеры
3B – 398B-A94B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Текст2024–2026

INTELLECT

Prime Intellect · США

Модели, обученные распределённо на видеокартах со всего мира. INTELLECT-3 на 106B дообучена с подкреплением для математики, кода и агентов.

  • Задачи с рассуждением и математикой
  • Помощь в программировании
  • Агенты с вызовом инструментов
Размеры
10B – 106B-A12B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Текст2024–2026

EuroLLM

Консорциум UTTER (Unbabel, университеты Лиссабона, Эдинбурга, Амстердама и др.) · Евросоюз

Европейские языковые модели, обученные на всех языках ЕС и ряде других, с упором на перевод. Русский есть. Свободная лицензия.

  • Перевод и локализация текстов
  • Ответы на вопросы на разных языках
  • Черновики писем для зарубежных партнёров
Размеры
1.7B – 22B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Перевод2026

TranslateGemma

Google · США

Переводчики на базе Gemma 3 на 55 языков, умеют переводить и текст на картинках. Русский есть. Версия 4B помещается на ноутбук.

  • Перевод документов и переписки
  • Перевод текста со скриншотов и фото
  • Локализация сайтов и приложений
Размеры
4B – 27B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Документы и OCR2025–2026

DeepSeek-OCR

DeepSeek · Китай

OCR-модель, которая сильно сжимает страницу в небольшое число визуальных токенов, поэтому быстро обрабатывает большие объёмы. Версия 2 лучше понимает порядок чтения.

  • Массовое распознавание сканов счетов и договоров
  • Распознавание таблиц
  • Перевод PDF в Markdown для поиска и RAG
Размеры
около 3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCR2026

GLM-OCR

Zhipu AI (Z.ai) · Китай

Лёгкая OCR-модель Zhipu для разбора документов. В карточке русский указан среди поддерживаемых языков; рассчитана на высокую нагрузку и слабое железо.

  • Распознавание счетов, договоров и накладных, в том числе на русском
  • Распознавание таблиц и формул
  • Извлечение полей в JSON
Размеры
0.9B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCR2025–2026

LightOnOCR

LightOn · Франция

Французская OCR-модель на 1B, которая переводит страницу в текст за один проход и быстро работает на потоке. Языки в карточке — европейские, китайский и японский, русского нет.

  • Распознавание счетов и договоров на европейских языках
  • Распознавание таблиц
  • Перевод PDF в текст для поиска и RAG
Размеры
0.9B – 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Код2025

Devstral

Mistral AI (с All Hands AI) · Франция

Модели Mistral для агентной разработки: сами читают репозиторий, правят файлы и запускают команды. Версия 24B помещается на одну видеокарту.

  • Агент-разработчик для исправления задач из трекера
  • Доработка внутренних систем по описанию
  • Автоматизация рутинных правок в коде
Размеры
24B – 123B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
3D2024–2025

TRELLIS

Microsoft · США

Одна из сильнейших открытых 3D-моделей: по картинке или тексту выдаёт сетку с текстурой или гауссову сцену. TRELLIS.2 заметно детальнее первой версии.

  • 3D-модели товаров и интерьера по фото
  • Ассеты для игр и AR/VR
  • Прототипы для 3D-печати
Размеры
до 4B (TRELLIS.2)
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Компьютерное зрение2024–2025

Depth Anything

ByteDance и Гонконгский университет · Китай

Определяет глубину — расстояние до каждой точки — по одной обычной фотографии или видео. DA3 восстанавливает геометрию сцены с нескольких кадров.

  • Оценка расстояний и объёмов по камере
  • Эффекты глубины для фото и видео
  • Навигация роботов и дронов
Размеры
25M – 1.4B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Речь в текст2025

Omnilingual ASR

Meta · США

Распознавание речи на 1600+ языках, включая русский и редкие языки, которые раньше не поддерживала ни одна система. Новый язык можно добавить по нескольким примерам.

  • Расшифровка на редких и местных языках
  • Оцифровка устных архивов
  • Субтитры на многих языках
Размеры
300M – 7B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текст2024–2025

SenseVoice / Paraformer / Fun-ASR

Alibaba (Tongyi, FunAudioLLM) · Китай

Набор моделей Alibaba для быстрого распознавания речи, в первую очередь китайской и азиатских языков. SenseVoice дополнительно определяет эмоции и звуковые события.

  • Расшифровка звонков
  • Определение эмоций в голосе
  • Распознавание смеха, музыки и других звуков
Размеры
около 230M – 800M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Синтез речи2024–2025

CosyVoice / Fun-CosyVoice

Alibaba (Tongyi, FunAudioLLM) · Китай

Синтез речи с клонированием голоса по короткому образцу и потоковой выдачей для живого диалога. Третья версия поддерживает 9 языков, включая русский.

  • Голос для бота и ассистента
  • Клонирование фирменного голоса
  • Озвучка роликов
Размеры
300M – 0.5B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2025

HyperCLOVA X SEED

Naver · Южная Корея

Открытые младшие модели корейского Naver: от 0.5B до 32B, включая рассуждающие Think и мультимодальные версии с пониманием картинок.

  • Лёгкий корейско-английский ассистент
  • Разбор картинок и документов
  • Классификация текстов
Размеры
0.5B – 32B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Текст2024–2025

T-Pro / T-Lite

Т-Банк · Россия

Модели Т-Банка, дообученные на основе Qwen специально для русского языка: заметно лучше исходной модели пишут и рассуждают по-русски. T-Lite — 8B, T-Pro — 32B на одну видеокарту.

  • Русскоязычный чат-бот поддержки
  • Разбор обращений и документов на русском
  • Ответы по базе знаний компании
Размеры
7B – 32B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текст2023–2025

CogVLM и GLM-V

Zhipu AI (Z.ai) и Университет Цинхуа · Китай

Модели зрения от Zhipu: сначала CogVLM, затем линейка GLM-V. GLM-4.6V умеет вызывать инструменты по картинкам и работать как агент с интерфейсом.

  • Ответы на вопросы по фото и документам
  • Агент, работающий с интерфейсом по скриншотам
  • Разбор графиков и отчётов
Размеры
9B – 106B-A12B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Видео2024–2025

HunyuanVideo

Tencent · Китай

Видеомодель Tencent, одна из первых открытых на уровне закрытых сервисов. Версия 1.5 стала легче (8.3B) и идёт на потребительских картах.

  • Видео по текстовому сценарию
  • Оживление изображений
  • База для дообучения своих видеомоделей
Размеры
8.3B – 13B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Математика и рассуждения2024–2025

DeepSeek-Math

DeepSeek · Китай

Математические модели DeepSeek. Первая версия 7B ввела метод обучения GRPO, V2 на 685B пишет и сама проверяет доказательства уровня олимпиад.

  • Расчёты и проверка формул
  • Проверка математических выкладок в отчётах
  • Разбор задач по шагам
Размеры
7B – 685B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
3D2025

SAM 3D

Meta · США

Восстанавливает 3D-форму предмета или тела человека по одной обычной фотографии, даже если объект частично закрыт. Две модели: Objects и Body.

  • 3D-модель предмета с фото из каталога
  • Оценка позы и формы тела по фото
  • Примерка и AR-сценарии
Размеры
н/д
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Текст2023–2025

Hermes

Nous Research · США

Дообучения Nous Research поверх Llama, Mistral, Qwen и Seed-OSS. Ценятся за точное следование инструкциям, вызов функций и ответы в строгом JSON; реже отказывают, чем исходные модели, у Hermes 4 есть режим рассуждений.

  • Агенты, вызывающие функции и API
  • Извлечение данных в строгом формате JSON
  • Ассистент с гибкой настройкой роли и тона
Размеры
3B – 405B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Синтез речи2022–2025

Silero TTS

Silero · Россия

Лёгкий синтез русской речи, работает на обычном процессоре. Версия v5 добавила языки СНГ и народов России: татарский, башкирский, якутский, казахский и другие.

  • Озвучка ответов голосового бота
  • Чтение текстов на русском
  • Голоса на языках народов России
Размеры
десятки мегабайт
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Синтез речи2025

Dia

Nari Labs · Южная Корея

Модель, которая озвучивает целые диалоги на два голоса со смехом, вздохами и паузами. Только английский.

  • Озвучка диалогов и подкастов
  • Рекламные ролики с живой речью
  • Сценки для обучения
Размеры
1B – 2B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Видео2025

LongCat-Video

Meituan · Китай

Видеомодель на 13.6B: из текста, из картинки и продолжение видео. Держит качество на роликах в несколько минут.

  • Длинные ролики
  • Видео из фото
  • Продолжение готового видео
Размеры
13.6B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Компьютерное зрение2023–2025

Grounding DINO / Rex-Omni

IDEA Research · Китай

Находит на картинке любые объекты по текстовому описанию, без обучения на своих данных: «красная коробка», «человек без каски». Rex-Omni — новое поколение на базе VLM.

  • Поиск объектов по описанию без разметки
  • Автоматическая разметка данных для обучения
  • Проверка фото на соответствие требованиям
Размеры
172M – 3B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Прогнозы2024–2025

Chronos

Amazon · США

Модели прогнозов Amazon, одни из самых скачиваемых. Chronos-2 учитывает внешние факторы: цены, акции, погоду.

  • Прогноз спроса с учётом акций и цен
  • Планирование запасов
  • Прогноз выручки и потоков клиентов
Размеры
8M – 710M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Музыка и звук2025

DiffRhythm

ASLP-lab (Северо-Западный политехнический университет) · Китай

Быстрая генерация полной песни с вокалом по тексту и образцу стиля, до нескольких минут звучания.

  • Песни и джинглы по тексту
  • Музыка для роликов
  • Демо-версии композиций
Размеры
около 1.1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Модерация и безопасность2025

gpt-oss-safeguard

OpenAI · США

Модерация по вашим правилам: политику пишете обычным текстом, модель рассуждает и выносит решение с объяснением. Построена на gpt-oss.

  • Модерация по внутренним правилам компании
  • Разметка спорных сообщений с объяснением
  • Проверка отзывов и объявлений перед публикацией
Размеры
20B – 120B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Картинка + текст2023–2025

Qwen-VL

Alibaba (команда Qwen) · Китай

Одна из сильнейших открытых моделей зрения: читает документы, таблицы, графики, видео, работает с интерфейсами. С Qwen3.5 зрение встроено прямо в основную модель Qwen.

  • Извлечение данных из сканов счетов и накладных
  • Разбор фотографий товаров и витрин
  • Анализ видео и записей с камер
Размеры
2B – 235B-A22B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCR2025

olmOCR

Ai2 (Allen Institute for AI) · США

Модель и набор инструментов для массового перевода PDF в чистый текст с сохранением порядка чтения, таблиц и формул. Рассчитана на обработку миллионов страниц.

  • Массовая оцифровка архива PDF
  • Распознавание договоров и отчётов в текст
  • Подготовка документов для поиска и RAG
Размеры
7B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Документы и OCR2025

Nanonets-OCR

Nanonets · США / Индия

Модель для перевода документов в Markdown с таблицами, печатями, подписями, галочками и водяными знаками. В карточке OCR2 русский указан среди языков.

  • Распознавание счетов, договоров и накладных, в том числе на русском
  • Распознавание печатей, подписей и отметок
  • Распознавание рукописного текста
Размеры
1.5B – 3B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
3D2024–2025

Hunyuan3D

Tencent · Китай

Открытая 3D-линейка Tencent: форма и текстура по картинке, качество на уровне платных сервисов. Omni добавляет управление позой и формой, Part делит модель на детали.

  • 3D-модели товаров с текстурой
  • Персонажи и предметы для игр
  • Разделение модели на детали для печати
Размеры
набор моделей: форма и текстуры
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Поиск и RAG2025

EmbeddingGemma

Google · США

Маленькая многоязычная модель эмбеддингов на базе Gemma 3, работает даже на телефоне и ноутбуке без интернета.

  • Поиск по документам на устройстве
  • RAG без отправки данных наружу
  • Классификация текстов
Размеры
300M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Роботы2025

π0 / π0.5 (openpi)

Physical Intelligence · США

Модели управления роботами от Physical Intelligence: складывание белья, уборка, работа с предметами. π0.5 лучше справляется в незнакомой обстановке.

  • Управление манипуляторами и двуруким роботом
  • Дообучение под свои операции
  • Пилоты по автоматизации ручного труда
Размеры
около 3B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Речь в текст2023–2025

Vosk (русские модели)

Alpha Cephei · Россия

Офлайн-распознавание русской речи, которое работает даже на Raspberry Pi и телефоне, без интернета. Есть потоковые модели для живого звука и простой русский синтез речи Vosk TTS.

  • Расшифровка звонков и записей на русском без облака
  • Голосовое управление в приложениях и киосках
  • Распознавание речи в потоке с малой задержкой
Размеры
около 45 МБ – 1,8 ГБ
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голосовые ассистенты2025

Qwen Omni

Alibaba (Qwen) · Китай

Модели, которые понимают текст, картинки, аудио и видео и отвечают голосом в реальном времени. Qwen3-Omni говорит на 10 языках, включая русский.

  • Голосовой ассистент для клиентов
  • Разбор звонков и видео
  • Ответы голосом по документам и картинкам
Размеры
3B – 30B-A3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2025

ERNIE 4.5

Baidu · Китай

Первая открытая линия Baidu: от крошечной 0.3B до MoE на 300 млрд параметров, есть версии с пониманием картинок. Средняя 21B-A3B помещается на одну видеокарту.

  • Корпоративный ассистент
  • Разбор документов и изображений
  • Классификация обращений
Размеры
0.3B – 300B-A47B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2024–2025

Vikhr

Vikhr Models · Россия

Русскоязычные дообучения открытых моделей (Mistral, Qwen, Llama) от независимой команды Vikhr: улучшают русский язык, есть компактные версии для обычного ПК.

  • Русскоязычный ассистент на своём ПК или сервере
  • Ответы по базе знаний (RAG)
  • Тексты и письма на русском
Размеры
0.5B – 24B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Модерация и безопасность2025

Qwen3Guard

Alibaba (Qwen) · Китай

Фильтры безопасности на 119 языков, русский в их числе. Версия Stream проверяет ответ бота прямо во время его генерации и может оборвать его на лету.

  • Фильтр запросов к боту на русском
  • Остановка опасного ответа во время генерации
  • Разметка сообщений по категориям риска
Размеры
0.6B – 8B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCR2025

SmolDocling и Granite-Docling

IBM и Hugging Face · США

Крошечные модели для открытого конвертера документов Docling: переводят страницу в разметку с таблицами, формулами и кодом. Работают на обычном ноутбуке.

  • Перевод PDF и сканов в Markdown для поиска и RAG
  • Распознавание таблиц из отчётов
  • Разбор счетов и договоров на обычном ПК
Размеры
256M – 258M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2025

gpt-oss

OpenAI · США

Первые открытые модели OpenAI со времён GPT-2. Рассуждения, вызов инструментов, младшая версия помещается на одну видеокарту.

  • ИИ-агент с вызовом внутренних систем
  • Ответы по регламентам
  • Черновики писем и отчётов
Размеры
20B, 120B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Аватары2025

MultiTalk / InfiniteTalk

Meituan · Китай

Дубляж и говорящие персонажи на базе Wan: MultiTalk ведёт диалог нескольких людей, InfiniteTalk переозвучивает видео любой длины с мимикой и телом.

  • Дубляж видео с подгонкой мимики
  • Диалог двух персонажей по аудио
  • Длинные ролики с ведущим
Размеры
14B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Математика и рассуждения2025

Kimina-Prover

Moonshot AI и Project Numina · Китай, Франция

Модели для формальных доказательств в Lean 4 от Moonshot AI (Kimi) и Numina. Есть маленькие версии от 0.6B, которые запускаются на ноутбуке.

  • Формальная проверка математических выкладок
  • Перевод задачи с обычного языка на Lean
  • Обучение и олимпиадная подготовка
Размеры
0.6B – 72B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Компьютерное зрение2023–2025

DINOv2 / DINOv3

Meta · США

Базовые модели, которые превращают картинку в числовой «отпечаток». На них строят поиск похожих изображений, классификацию и сегментацию без большой разметки.

  • Поиск похожих товаров и фото
  • Классификация изображений на малых данных
  • Основа для своих моделей контроля качества
Размеры
21M – 7B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Прогнозы2024–2025

Moirai

Salesforce · США

Универсальная модель прогнозов Salesforce для рядов с разной частотой и многими переменными. Веса открыты только для исследований.

  • Исследовательские пилоты прогнозов
  • Сравнение с другими моделями прогнозов
  • Прогнозы по многим связанным рядам
Размеры
11M – 311M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Текст2024–2025

Ruadapt (RuadaptQwen)

НИВЦ МГУ, лаборатория LAIR (RefalMachine) · Россия

Модели Qwen, переделанные под русский язык: заменён токенизатор и проведено дообучение на русских текстах. За счёт этого русский текст генерируется до двух раз быстрее, чем у исходной модели того же размера.

  • Русскоязычный ассистент на своём сервере
  • Ответы по документам компании (RAG) на русском
  • Разбор и пересказ длинных русских текстов
Размеры
1.5B – 32B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2025

Seed-OSS

ByteDance · Китай

Открытая модель ByteDance на 36B с контекстом до 512 тыс. токенов и настраиваемым «бюджетом размышлений». Помещается на одну мощную видеокарту.

  • Разбор длинных документов
  • Агенты с инструментами
  • Корпоративный ассистент
Размеры
36B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Текст2024–2025

Grok (открытые веса)

xAI · США

xAI выкладывает веса прошлых поколений Grok. Модели очень большие и требуют кластера видеокарт, поэтому на практике их запускают редко.

  • Исследования больших моделей
  • Ассистент на собственной инфраструктуре
  • Генерация и анализ текстов
Размеры
314B (Grok-1), Grok-2 крупнее
Железо
от: Кластер
Коммерция с условиямиПодробнее
Примерка одежды2025

OmniTry

Kunbyte AI · Китай

Примерка не только одежды: очки, серьги, сумки, шляпы, часы и другие аксессуары. Работает без маски. Требует видеокарту от 28 ГБ.

  • Примерка аксессуаров и украшений на фото
  • Карточки товара с аксессуаром на модели
  • Примерочная очков и бижутерии на сайте
Размеры
дополнение к FLUX.1 Fill dev 12B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Медицина2025

MedSigLIP

Google · США

Лёгкий кодировщик медицинских снимков и текста от Google, тот же, что внутри MedGemma. Сортирует и ищет похожие снимки. Не заменяет врача, решения принимает специалист.

  • Поиск похожих снимков в архиве клиники
  • Предварительная сортировка снимков для врача
  • Основа для своих классификаторов снимков
Размеры
около 0.9B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Медицина2025

II-Medical

Intelligent Internet · Великобритания

Рассуждающие медицинские модели на Qwen3, которые рассчитаны на запуск на обычном компьютере. Не заменяет врача, решения принимает специалист.

  • Справочные ответы персоналу с ходом рассуждения
  • Черновики выписок для проверки врачом
  • Поиск по медицинской литературе
Размеры
7B – 32B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текст2025

T-one

Т-Банк · Россия

Компактная потоковая модель Т-Банка для распознавания русской речи в телефонных разговорах. Работает в реальном времени даже без видеокарты.

  • Расшифровка телефонных звонков
  • Голосовые роботы на линии
  • Контроль качества разговоров
Размеры
72M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2024–2025

SmolLM

Hugging Face · США

Крошечные открытые модели Hugging Face для телефонов и ноутбуков. SmolLM3 на 3B умеет рассуждать и держит длинный контекст, весь рецепт обучения открыт.

  • Простой ассистент прямо на устройстве
  • Классификация и маршрутизация обращений
  • Основа для дообучения под узкую задачу
Размеры
135M – 3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Перевод2025

Seed-X

ByteDance Seed · Китай

Компактный переводчик ByteDance на 28 языков, по качеству близкий к крупным закрытым системам. Русский есть. Есть готовые сжатые версии.

  • Перевод деловой переписки и документов
  • Перевод карточек товаров
  • Перевод технических и юридических текстов
Размеры
7B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Примерка одежды2025

FastFit

LavieAI и Университет Сунь Ятсена · Китай

Примерка сразу нескольких вещей за раз: верх, низ, обувь, сумка. Быстрее прежних моделей за счёт кэширования. Лицензия некоммерческая.

  • Сборка образа из нескольких товаров на одной модели
  • Пилот «собери лук» на сайте
  • Прототипы лукбуков без съёмки
Размеры
на базе SD 1.5 inpainting
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Обработка фото2024–2025

BiRefNet

Нанькайский университет · Китай

Открытая модель точного выделения объекта и удаления фона под лицензией MIT. На ней построен RMBG-2.0. Есть версии для 2K и для волос и полупрозрачных краёв.

  • Удаление фона с фото товаров потоком
  • Точные маски для дизайна и печати
  • Вырезка людей с волосами для рекламы
Размеры
около 220M (есть облегчённые lite)
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинки2024–2025

OmniGen

BAAI (Пекинская академия ИИ) · Китай

Универсальная модель: генерирует, редактирует, переносит объект или человека с фото в новую сцену без отдельных плагинов.

  • Перенос товара или человека в новую сцену
  • Редактирование фото по инструкции
  • Генерация по нескольким референсам
Размеры
около 4B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Математика и рассуждения2025

AceMath / AceReason

NVIDIA · США

Модели NVIDIA для математики и рассуждений на базе Qwen. AceReason дообучена с подкреплением сначала на математике, потом на коде.

  • Расчёты и проверка формул
  • Сложная аналитика с пошаговым разбором
  • Разбор задач по программированию
Размеры
1.5B – 72B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Роботы2025

SmolVLA

Hugging Face · США

Маленькая модель управления роботом, которая работает на обычном ноутбуке. Обучена на открытых данных сообщества LeRobot, подходит для недорогих манипуляторов.

  • Управление недорогим манипулятором
  • Быстрые пилоты и демо роботизации
  • Обучение персонала и студентов
Размеры
450M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Перевод2024–2025

Tower

Unbabel · Португалия

Языковые модели, заточенные под перевод и работу с многоязычными текстами: перевод, правка, оценка качества перевода. Русский есть. Некоммерческая лицензия.

  • Перевод с учётом контекста и терминов
  • Редактура машинного перевода
  • Оценка качества готового перевода
Размеры
2B – 72B
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Обработка фото2025

SeedVR / SeedVR2

ByteDance Seed · Китай

Восстановление и увеличение видео и фото от ByteDance. SeedVR2 делает это за один шаг, поэтому заметно быстрее похожих моделей. Коммерческая лицензия.

  • Увеличение фото и видео до 2K–4K
  • Восстановление старых роликов и снимков
  • Улучшение пользовательских фото перед публикацией
Размеры
3B – 7B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Картинка + текст2025

Kimi-VL

Moonshot AI · Китай

Экономичная MoE-модель зрения (16B, активны 3B) с длинным контекстом и рассуждающей версией. Хорошо разбирает длинные документы и видео.

  • Разбор длинных PDF и презентаций
  • Ответы на вопросы по видео
  • Работа с интерфейсами по скриншотам
Размеры
16B-A3B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Текст2025

DeepSeek-R1

DeepSeek · Китай

Рассуждающая модель: думает по шагам перед ответом. Сильна в расчётах, логике и коде; есть компактные дистиллированные версии.

  • Сложные расчёты и проверка логики
  • Анализ договоров и регламентов
  • Помощь программистам
Размеры
1,5B – 671B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Код2025

Seed-Coder

ByteDance Seed · Китай

Компактная модель для кода 8B от ByteDance: базовая, инструктивная и рассуждающая версии. Данные для обучения отбирала сама модель, почти без ручных правил.

  • Автодополнение и генерация кода
  • Решение алгоритмических задач
  • Основа для дообучения под свой стек
Размеры
8B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинки2025

BAGEL

ByteDance Seed · Китай

Единая модель, которая и понимает картинки, и генерирует, и редактирует их по диалогу. Похожа на то, как работают картинки в ChatGPT.

  • Редактирование фото в диалоге
  • Ответы на вопросы по изображению
  • Генерация картинок с пояснениями
Размеры
14B-A7B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Аватары2025

HunyuanVideo-Avatar

Tencent · Китай

Говорящие персонажи на базе HunyuanVideo: передаёт эмоции голоса, работает с несколькими персонажами и разными стилями.

  • Видео с ведущим по фото и аудио
  • Сцены с несколькими говорящими
  • Мультяшные персонажи
Размеры
около 13B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Разбор текста2023–2025

RuModernBERT и USER (deepvk)

deepvk (VK) · Россия

Русские энкодеры от команды VK: RuModernBERT читает длинные тексты, USER даёт векторы для поиска, GeRaCl классифицирует тексты по темам без обучения.

  • Классификация обращений без размеченных данных
  • Поиск по базе знаний на русском
  • Разбор длинных договоров
Размеры
35M – 360M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2023–2025

Llama

Meta · США

Модели, с которых начался массовый open source в ИИ. Огромная экосистема дообученных версий и инструментов.

  • Ассистент для сотрудников
  • Суммаризация встреч и документов
  • Основа для дообучения под отрасль
Размеры
1B – 405B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Математика и рассуждения2024–2025

DeepSeek-Prover

DeepSeek · Китай

Модели DeepSeek для формальных доказательств на языке Lean 4: доказательство проверяет программа, а не человек. Узкий инструмент для математиков и инженеров.

  • Формальная проверка математических выкладок
  • Проверка корректности алгоритмов
  • Обучение и олимпиадная подготовка
Размеры
7B – 671B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Текст2023–2025

Saiga

Илья Гусев (IlyaGusev) · Россия

Самая известная русскоязычная доучка сообщества: чужие открытые модели (Llama, Mistral, Gemma, YandexGPT) дообучены отвечать на русском как ассистент. Удобная отправная точка для русского чат-бота на своём сервере.

  • Чат-ассистент на русском языке
  • Ответы на вопросы по базе знаний компании
  • Черновики писем, описаний и постов на русском
Размеры
7B – 70B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Модерация и безопасность2023–2025

Llama Guard

Meta · США

Модели-фильтры, которые проверяют запросы к чат-боту и его ответы на опасные темы по списку категорий. Версия 4 проверяет и картинки. Русский официально не заявлен.

  • Проверка вопросов пользователей к боту
  • Проверка ответов бота перед отправкой
  • Отчёт, какая категория правил нарушена
Размеры
1B – 12B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Модерация и безопасность2024–2025

Prompt Guard

Meta · США

Крошечные классификаторы, которые ловят попытки взломать бота: промпт-инъекции и обход правил. Версия 86M многоязычная, 22M только английский.

  • Защита бота от промпт-инъекций
  • Проверка писем и документов, которые попадают в ИИ-агента
  • Быстрый фильтр перед большой моделью
Размеры
22M – 86M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Примерка одежды2024–2025

CatVTON / CatV2TON

Университет Сунь Ятсена и Pixocial · Китай

Лёгкая модель примерки, запускается на обычной видеокарте. Есть версия без маски и CatV2TON, который примеряет одежду и на видео.

  • Примерка вещи на фото покупателя
  • Черновые карточки товара на модели
  • Примерка на коротком видео
Размеры
899M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Картинка + текст2024–2025

SmolVLM

Hugging Face · Франция / США

Самые маленькие модели зрения Hugging Face: от 256M, работают в браузере и на телефоне. SmolVLM2 понимает и видео.

  • Описание фото и видео на слабом железе
  • Чтение простых документов
  • Встраивание в мобильные и офлайн-приложения
Размеры
256M – 2.2B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинки2024–2025

SANA

NVIDIA · США

Быстрая модель картинок от NVIDIA: 4K-изображения за секунды и работа даже на ноутбучной видеокарте. Версия Sprint генерирует в 1–2 шага.

  • Массовая генерация картинок
  • Визуалы высокого разрешения
  • Генерация в реальном времени в приложениях
Размеры
0.6B – 4.8B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Видео2024–2025

Open-Sora

HPC-AI Tech · Сингапур

Полностью открытый проект видеогенерации: веса, код и рецепт обучения. Версия 2.0 на 11B делает видео из текста и из картинки.

  • Видео по текстовому описанию
  • Оживление картинок
  • Обучение своей видеомодели
Размеры
до 11B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Видео2025

Step-Video

StepFun · Китай

Крупная видеомодель на 30B с роликами до 204 кадров. Требует серверного железа, зато открыта под MIT.

  • Видео по описанию
  • Оживление изображений
Размеры
30B
Железо
от: Кластер
Можно в коммерциюПодробнее
Аватары2024–2025

MuseTalk

Tencent Music (Lyra Lab) · Китай

Синхронизация губ в реальном времени: подгоняет рот на видео под новое аудио. Подходит для перевода видео и живых аватаров.

  • Дубляж видео на другой язык
  • Живой аватар в видеочате
  • Правка речи в готовом ролике
Размеры
меньше 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Математика и рассуждения2024–2025

QwQ

Qwen (Alibaba) · Китай

Первая открытая рассуждающая модель Qwen: думает по шагам перед ответом и на задачах по математике близка к DeepSeek-R1 при 32B параметров.

  • Расчёты и проверка формул
  • Сложная аналитика с пошаговым разбором
  • Проверка логики договоров и регламентов
Размеры
32B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Математика и рассуждения2025

s1

Стэнфордский университет · США

Рассуждающая модель, обученная всего на тысяче задач. Умеет думать дольше по команде, чтобы точнее ответить на сложный вопрос.

  • Расчёты и проверка формул
  • Разбор сложных задач по шагам
  • Обучение
Размеры
1.5B – 32B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Математика и рассуждения2025

Light-R1

Qihoo 360 · Китай

Рассуждающие модели Qihoo 360: обычную Qwen2.5 дообучили длинным рассуждениям по открытому рецепту, данные и код выложены.

  • Расчёты и проверка формул
  • Разбор задач по шагам
  • Основа для своего дообучения рассуждениям
Размеры
7B – 32B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Поиск и RAG2024–2025

Nomic Embed

Nomic AI · США

Полностью открытые эмбеддинги — с весами, данными и кодом обучения. v2 многоязычная на MoE, есть версии для кода и для поиска по PDF-страницам.

  • Поиск по документам и базе знаний
  • Поиск по коду
  • Поиск по сканам и PDF без распознавания
Размеры
137M – 7B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речи2023–2025

Piper

Rhasspy / Open Home Foundation · США

Очень быстрый синтез речи, который работает даже на Raspberry Pi. Готовые голоса на 35+ языках, есть несколько русских.

  • Озвучка уведомлений и ответов бота
  • Голос для устройств без интернета
  • Голосовые меню
Размеры
около 5M – 30M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Синтез речи2024–2025

F5-TTS

Шанхайский университет Цзяотун и партнёры · Китай

Модель клонирования голоса по нескольким секундам образца, английский и китайский. Сообщество выпустило много дообученных версий под другие языки, в том числе русский.

  • Клонирование голоса
  • Озвучка аудиокниг и роликов
  • Исследования и прототипы
Размеры
около 340M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Синтез речи2025

Orpheus TTS

Canopy Labs · США

Синтез речи на основе языковой модели с живыми интонациями и эмоциональными вставками. Быстро отвечает, подходит для голосовых ассистентов. В основном английский.

  • Голос для ассистента в реальном времени
  • Эмоциональная озвучка
  • Клонирование голоса
Размеры
3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речи2025

Sesame CSM

Sesame · США

Модель разговорной речи, которая учитывает контекст беседы и звучит как живой собеседник. Только английский.

  • Голос для разговорного ассистента
  • Озвучка диалогов
  • Прототипы голосовых продуктов
Размеры
1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Модерация и безопасность2024–2025

ShieldGemma

Google · США

Фильтры на базе Gemma: проверяют текст на опасный и оскорбительный контент, а ShieldGemma 2 проверяет картинки. Ориентированы на английский.

  • Модерация сообщений пользователей
  • Проверка ответов бота
  • Проверка сгенерированных картинок перед публикацией
Размеры
2B – 27B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Математика и рассуждения2025

Sky-T1

NovaSky (Sky Computing Lab, Беркли) · США

Рассуждающая модель из Беркли, обученная меньше чем за 450 долларов. Показала, что рассуждения уровня o1-preview можно повторить малыми силами.

  • Расчёты и проверка формул
  • Разбор задач по шагам
  • Основа для своего дообучения рассуждениям
Размеры
7B – 32B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Компьютерное зрение2023–2025

SigLIP (наследник CLIP)

Google · США

Модели, которые переводят картинки и текст в общее пространство: можно искать фото по словам и классифицировать изображения без обучения. CLIP от OpenAI (2021) — предшественник.

  • Поиск картинок по текстовому запросу
  • Автоматическая разметка и теги каталога
  • Фильтрация недопустимого контента
Размеры
около 0.2B – 2B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Роботы2024–2025

OpenVLA

Стэнфорд, Беркли и партнёры · США

Первая крупная открытая модель «зрение-язык-действие»: робот-манипулятор выполняет команды вроде «положи яблоко в миску». OFT ускоряет её в разы.

  • Управление манипулятором по текстовой команде
  • Пилоты по роботизации простых операций
  • Основа для дообучения под свой робот
Размеры
7B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Текст2023–2025

Tulu

Ai2 · США

Дообучения Llama от Ai2 с полностью открытым рецептом: данные, код и все промежуточные этапы. Tulu 3 на 405B — одна из самых крупных открыто дообученных моделей; по этому же рецепту делают чат-версии OLMo.

  • Ассистент для сотрудников на своём сервере
  • Математика и точное следование инструкциям
  • Образец рецепта для собственного дообучения
Размеры
7B – 405B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Синтез речи2024–2025

Kokoro

hexgrad (независимый разработчик) · не указана

Крошечная модель синтеза речи (82M), которая звучит на уровне крупных. Работает на обычном процессоре; английский и ещё несколько языков, русского нет.

  • Озвучка статей и уведомлений
  • Голос для приложений без видеокарты
  • Массовая озвучка текстов
Размеры
82M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Примерка одежды2025

Any2AnyTryon

Пекинский университет почты и связи и др. · Китай

Универсальный набор для одежды на базе FLUX: примерка, генерация модели в заданной вещи и «снятие» вещи с человека в отдельное фото товара.

  • Примерка по фото товара
  • Фото модели в вещи по текстовому описанию
  • Чистое фото вещи со снимка человека
Размеры
дополнения (LoRA) к FLUX.1 dev 12B
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Математика и рассуждения2024–2025

Qwen2.5-Math

Qwen (Alibaba) · Китай

Математические версии Qwen: решают задачи по шагам и умеют считать через код. Есть модели-оценщики, которые проверяют каждый шаг решения.

  • Расчёты и проверка формул
  • Проверка расчётов в сметах и отчётах
  • Разбор задач по шагам
Размеры
1.5B – 72B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
3D2024–2025

Stable Fast 3D / SPAR3D

Stability AI · Великобритания

Модели Stability AI, которые за секунду превращают одну фотографию в 3D-модель с текстурой. SPAR3D позволяет поправить форму через облако точек.

  • 3D-карточки товаров по фото
  • Ассеты для игр и AR
  • Быстрые макеты для дизайна
Размеры
1B – 2B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Поиск и RAG2023–2025

GTE

Alibaba · Китай

Эмбеддинги и реранкеры Alibaba для поиска: от крошечных до 7B на базе Qwen2. Есть многоязычная версия mGTE с длинным контекстом.

  • Смысловой поиск по документам
  • Переранжирование результатов поиска
  • Кластеризация и классификация текстов
Размеры
33M – 7B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Разбор текста2024–2025

ModernBERT

Answer.AI и LightOn · США / Франция

Современная замена классическому BERT: быстрее, читает до 8 тысяч токенов за раз. Основа для своих классификаторов. Обучена на английском и коде, для русского есть RuModernBERT.

  • Классификация обращений и документов
  • Поиск нужных фрагментов в длинных текстах
  • Основа для своего классификатора после дообучения
Размеры
150M – 395M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Обработка фото2024–2025

BEN2

Prama LLC · США

Модель удаления фона с упором на сложные края: волосы, мех, тонкие детали. Открытая версия под MIT, умеет обрабатывать видео.

  • Вырезка товара и людей с фото
  • Удаление фона на видео
  • Подготовка фото для каталога
Размеры
около 95M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текст2024–2025

Janus

DeepSeek · Китай

Одна модель и понимает картинки, и рисует их по описанию. Janus-Pro-7B была заметна в начале 2025 года, но по качеству картинок уступает специализированным моделям.

  • Ответы на вопросы по картинкам
  • Черновые иллюстрации по описанию
  • Эксперименты с единой моделью зрения и генерации
Размеры
1B – 7B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Примерка одежды2024

Leffa

Meta AI (вместе с King's College London) · США

Модель Meta для примерки и смены позы человека на фото. Бережно переносит мелкие детали ткани и надписи. Лицензия MIT, но обучающие данные некоммерческие.

  • Примерка одежды на фото модели
  • Смена позы модели на уже снятом кадре
  • Добор ракурсов для карточки товара
Размеры
на базе Stable Diffusion
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Примерка одежды2024

FitDiT

Tencent и Фуданьский университет · Китай

Примерка на трансформере от Tencent: точнее передаёт фактуру ткани, мелкий принт и длину вещи. Лицензия некоммерческая.

  • Примерка вещей со сложным принтом и фактурой
  • Карточки товара на модели для тестов
  • Подбор длины и посадки на фото
Размеры
на базе SD3
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Видео2024

CogVideoX

Zhipu AI (Z.ai) и Университет Цинхуа · Китай

Модель видео на 2–5B, которая запускается на одной игровой видеокарте. Популярная база для исследований и надстроек.

  • Короткие ролики из текста
  • Оживление изображений
  • Эксперименты с дообучением видео
Размеры
2B – 5B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Синтез речи2024

Parler-TTS

Hugging Face · США

Синтез речи, где голос задаётся текстовым описанием («спокойный женский голос, чистая запись»). Английский и 8 европейских языков, русского нет.

  • Подбор голоса по описанию
  • Озвучка роликов
  • Прототипы голосовых сервисов
Размеры
880M – 2.2B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Музыка и звук2023–2024

MusicGen (AudioCraft)

Meta · США

Генерация инструментальной музыки по текстовому описанию или по мелодии-образцу. Одна из первых открытых моделей такого рода.

  • Черновые музыкальные наброски
  • Музыка для прототипов роликов
  • Исследования
Размеры
300M – 3.3B
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Картинка + текст2024

PaliGemma

Google · США

Модель зрения Google на базе Gemma, задуманная как основа для дообучения под узкую задачу: подписи, поиск объектов, чтение текста.

  • Дообучение под свою задачу распознавания
  • Поиск объектов на фото
  • Чтение текста на изображениях
Размеры
3B – 28B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Документы и OCR2024

GOT-OCR 2.0

StepFun · Китай

Одна из первых универсальных OCR-моделей нового поколения: текст, формулы, таблицы, ноты и схемы. Маленькая, работает на слабом железе, но уже уступает новинкам.

  • Распознавание сканов счетов и договоров
  • Перевод таблиц в редактируемый вид
  • Распознавание формул и схем
Размеры
580M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Речь в текст2022–2024

Whisper

OpenAI · США

Распознавание речи на 99 языках, включая русский. Стандарт де-факто для расшифровки звонков и встреч.

  • Расшифровка звонков и созвонов
  • Субтитры к видео
  • Голосовые сообщения в текст
Размеры
39M – 1,5B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинки2022–2024

Stable Diffusion

Stability AI · Великобритания

Модель, с которой началась открытая генерация картинок. Огромная экосистема дообучений, стилей и плагинов, работает даже на домашнем ПК.

  • Иллюстрации и баннеры для рекламы
  • Фоны и сцены для карточек товаров
  • Дообучение под фирменный стиль
Размеры
0.9B – 8B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Видео2024

Mochi

Genmo · США

Открытая видеомодель на 10B с реалистичным движением. На момент выхода была одной из сильнейших открытых, сейчас обновлений нет.

  • Видео по описанию
  • Короткие рекламные сцены
Размеры
10B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Код2023–2024

DeepSeek-Coder

DeepSeek · Китай

Линейка моделей для кода от DeepSeek: от маленьких для автодополнения до большой MoE V2, которая в 2024 году была на уровне закрытых моделей. Позже код ушёл в общие модели DeepSeek.

  • Автодополнение и генерация кода
  • Перевод кода между языками
  • Поиск ошибок и объяснение чужого кода
Размеры
1.3B – 236B-A21B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Модерация и безопасность2024

Piiranha

iiiorg · не указана

Популярный детектор 17 типов персональных данных на шести европейских языках. Русского нет, лицензия некоммерческая — подходит для проб и исследований.

  • Поиск персональных данных в текстах
  • Сравнение качества детекторов PII
Размеры
278M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Обработка фото2024

Flux.1-dev ControlNet Upscaler

Jasper AI · США

Дополнение к FLUX для увеличения маленьких и размытых картинок с дорисовкой деталей. Популярно, но под некоммерческой лицензией FLUX dev.

  • Увеличение мелких картинок с дорисовкой
  • Улучшение сгенерированных изображений
  • Пилоты апскейла для каталога
Размеры
дополнение к FLUX.1 dev 12B
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Перевод2023–2024

ALMA и X-ALMA

Университет Джонса Хопкинса и Microsoft · США

Исследовательские переводчики на основе Llama 2. Первая ALMA знала 5 пар с английским, включая русский; X-ALMA расширила охват до 50 языков.

  • Перевод между английским и русским
  • Эксперименты с переводом на базе языковых моделей
  • Основа для дообучения переводчика
Размеры
7B – 13B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Картинка + текст2023–2024

IDEFICS

Hugging Face · Франция / США

Открытые модели зрения от Hugging Face, воспроизводившие закрытую Flamingo. Idefics3 стала основой для компактной линейки SmolVLM.

  • Ответы на вопросы по картинкам
  • Разбор документов и скриншотов
  • Основа для дообучения
Размеры
8B – 80B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Код2024

Codestral

Mistral AI · Франция

Модель Mistral для кода на 80+ языках программирования. Открытые веса основной версии нельзя использовать в работе без платной лицензии; новые версии Codestral только по API.

  • Оценка и тесты перед покупкой лицензии
  • Автодополнение кода (при коммерческой лицензии)
  • Исследование качества моделей для кода
Размеры
7B – 22B
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Картинки2023–2024

ControlNet

Лвминь Чжан (Стэнфорд) и сообщество · США

Надстройка над моделями картинок: задаёт позу, контуры, глубину или планировку, чтобы результат точно повторял нужную композицию.

  • Картинка по эскизу или контуру
  • Сохранение позы и композиции
  • Визуализация интерьеров по планировке
Размеры
0.4B – 1.3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Видео2023–2024

AnimateDiff

Shanghai AI Lab и CUHK · Китай

Модуль, который оживляет модели картинок Stable Diffusion и превращает их в короткую анимацию. Одна из первых открытых видеотехнологий.

  • Короткие анимации в фирменном стиле
  • Живые обложки и баннеры
  • Анимированные стикеры
Размеры
модуль движения поверх SD 1.5 / SDXL
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Аватары2024

LivePortrait

Kuaishou (Kling) · Китай

Оживляет портрет по видео-образцу: мимика и повороты головы переносятся с актёра на фото. Быстро работает даже на слабой видеокарте.

  • Оживление портретов
  • Перенос мимики актёра на персонажа
  • Анимация маскотов
Размеры
меньше 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Медицина2023–2024

Med42

M42 Health · ОАЭ

Клинические модели абу-дабийской M42 на основе Llama, настроенные отвечать на медицинские вопросы. Не заменяет врача, решения принимает специалист.

  • Справочные ответы персоналу по клиническим вопросам
  • Черновики выписок и писем для проверки врачом
  • Поиск по медицинской литературе
Размеры
8B – 70B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Разбор текста2020–2024

ruBERT, ruRoBERTa, ruELECTRA (ai-forever)

SberDevices (ai-forever) · Россия

Русскоязычные энкодеры Сбера, обученные на больших русских корпусах. Основа для классификаторов, NER и поиска по смыслу на русском.

  • Классификация обращений на русском
  • Извлечение имён, сумм и дат после дообучения
  • Определение тональности отзывов
Размеры
около 30M – 430M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Модерация и безопасность2024

WildGuard

Ai2 (Allen Institute for AI) · США

Открытый фильтр Ai2: одним проходом определяет, опасен ли запрос, опасен ли ответ и не отказал ли бот зря. Работает на английском.

  • Проверка запросов к боту
  • Проверка ответов бота
  • Поиск лишних отказов бота на безобидные вопросы
Размеры
7B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Картинка + текст2024

Florence-2

Microsoft · США

Очень маленькая модель зрения: подписи, поиск объектов, сегментация и чтение текста по одной команде. Работает даже на процессоре.

  • Чтение текста на фото
  • Поиск и выделение объектов
  • Автоматические подписи к фото
Размеры
0.23B – 0.77B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2023–2024

OpenChat

OpenChat (Университет Цинхуа) · Китай

Дообучения Mistral 7B и Llama 3 8B по методу C-RLFT, которые в 2023–2024 годах догоняли ChatGPT-3.5 при размере 7–8B. Лёгкий универсальный ассистент для слабого сервера.

  • Чат-ассистент на недорогом сервере
  • Черновики писем и ответов
  • Помощь с простым кодом
Размеры
7B – 13B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Текст2023–2024

Yi

01.AI · Китай

Двуязычные (английский и китайский) модели 01.AI на 6–34B с версиями на контекст до 200 тыс. токенов. Новых открытых выпусков с 2024 года нет.

  • Чат-ассистент на одной видеокарте
  • Разбор длинных документов
  • Классификация и извлечение данных из текста
Размеры
6B – 34B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Обработка фото2023–2024

PowerPaint

Shanghai AI Laboratory (OpenMMLab) и Университет Цинхуа · Китай

Универсальная дорисовка фото: убрать объект, вставить новый по описанию, заменить форму или расширить кадр за края.

  • Удаление и замена объектов на фото
  • Расширение кадра под нужный формат
  • Вставка товара или детали по текстовому описанию
Размеры
на базе SD 1.5
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Обработка фото2024

IC-Light

Лвмин Чжан (автор ControlNet) · США

Меняет освещение на фото: ставит объект или человека в новый свет по описанию или под заданный фон, чтобы вырезка смотрелась естественно.

  • Подгонка света товара под новый фон
  • Студийный свет для портретов без пересъёмки
  • Единый стиль освещения в каталоге
Размеры
на базе SD 1.5
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Код2023–2024

StarCoder

BigCode (Hugging Face и ServiceNow) · США / Франция

Одна из первых открытых моделей для кода, обучена на открытом наборе исходников с возможностью исключить свой репозиторий. Сегодня скорее база для дообучения, чем лидер.

  • Автодополнение кода в редакторе
  • Дообучение на внутреннем коде компании
  • Генерация шаблонного кода и тестов
Размеры
1B – 15B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Картинки2023–2024

PixArt

Huawei Noah's Ark Lab и партнёры · Китай

Компактная модель картинок на 0.6B с качеством уровня крупных. Умеет 4K в версии Sigma, подходит для скромного железа.

  • Иллюстрации для статей и соцсетей
  • Фоны для карточек товаров
  • Быстрые черновики визуалов
Размеры
0.6B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Медицина2024

BioMistral

Авиньонский университет и Нантский университет · Франция

Mistral 7B, дообученная на статьях PubMed Central, плюс несколько слияний с общей моделью. Компактная и простая в запуске. Не заменяет врача, решения принимает специалист.

  • Поиск и пересказ медицинских статей
  • Черновики справочных материалов для персонала
  • Разбор медицинской терминологии
Размеры
7B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Медицина2024

OpenBioLLM

Saama AI Research · Индия

Llama 3, дообученная на медицинских и биологических данных. Одна из первых сильных открытых медицинских моделей 2024 года. Не заменяет врача, решения принимает специалист.

  • Извлечение данных из медицинских документов
  • Черновики выписок для проверки врачом
  • Поиск по медицинской литературе
Размеры
8B, 70B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
3D2024

InstantMesh

Tencent ARC · Китай

Делает 3D-сетку по одной картинке примерно за 10 секунд: сначала рисует объект с нескольких ракурсов, потом собирает из них модель.

  • 3D-модель объекта по фото
  • Заготовки для игр и визуализаций
  • Прототипы для 3D-печати
Размеры
н/д
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Текст2023–2024

Zephyr

Hugging Face (H4) · США

Учебные чат-модели Hugging Face на базе Mistral, Gemma и Mixtral с открытым рецептом дообучения. Zephyr 7B Beta показал, что маленькую модель можно «воспитать» до уровня крупных без ручной разметки людьми.

  • Лёгкий чат-ассистент
  • Образец и отправная точка для своего дообучения
  • Черновики текстов и ответов
Размеры
7B – 141B-A35B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Примерка одежды2024

IDM-VTON

KAIST и OMNIOUS.AI · Южная Корея

Одна из самых известных открытых примерок: переносит вещь с фото товара на фото человека, хорошо держит принты и логотипы. Лицензия некоммерческая.

  • Пилот примерочной на сайте магазина
  • Прототип карточек товара на модели без фотосессии
  • Сравнение с коммерческими сервисами примерки
Размеры
на базе SDXL
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Текст2023–2024

FRED-T5

Сбер (ai-forever) · Россия

Русская модель «текст в текст» от Сбера, наследница ruT5 (2021). Небольшая и быстрая: её дообучают на пересказ, перефразирование и исправление ошибок в русском тексте, есть готовые версии проверки орфографии SAGE.

  • Исправление орфографии и опечаток в русском тексте
  • Краткий пересказ и перефразирование
  • Нормализация заявок и обращений перед обработкой
Размеры
95M – 1.7B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Примерка одежды2024

OOTDiffusion

Xiao-i Research · Китай

Ранняя популярная открытая примерка: одна версия для верхней одежды по пояс, другая для образа в полный рост. Лицензия некоммерческая.

  • Примерка верха на фото модели
  • Примерка в полный рост: верх, низ, платья
  • Прототип примерочной для тестов
Размеры
на базе Stable Diffusion
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Картинки2023–2024

Playground

Playground AI · США

Модель на архитектуре SDXL с упором на эстетику: яркие цвета, контраст, портреты. Совместима с инструментами экосистемы SDXL.

  • Эстетичные рекламные визуалы
  • Портреты и лайфстайл-картинки
  • Обложки для постов
Размеры
около 2.6B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Поиск и RAG2022–2024

E5 / multilingual-e5

Microsoft · США

Проверенные модели для смыслового поиска. Многоязычные версии хорошо работают с русским и до сих пор служат надёжной основой для RAG.

  • Поиск по базе знаний и документам
  • Подбор ответов для чат-бота (RAG)
  • Поиск похожих обращений и дублей
Размеры
33M – 7B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Прогнозы2024

Lag-Llama

ServiceNow, Mila и партнёры · Канада

Одна из первых открытых моделей прогнозов «из коробки». Крошечная, даёт вероятностный прогноз, сейчас уступает Chronos и TimesFM.

  • Вероятностный прогноз продаж
  • Быстрые пилоты прогнозирования
  • Базовая модель для сравнения
Размеры
2.4M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Примерка одежды2024

StableVITON

KAIST · Южная Корея

Исследовательская модель примерки с конференции CVPR 2024, одна из первых на базе Stable Diffusion. Сейчас чаще служит точкой сравнения.

  • Пилот примерки верхней одежды
  • Сравнение качества разных моделей примерки
  • Обучение своей примерки на базе открытого кода
Размеры
на базе Stable Diffusion
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Обработка фото2024

SUPIR

XPixel Group (Шэньчжэньский институт передовых технологий АН Китая, Shanghai AI Lab и др.) · Китай

Мощное восстановление сильно испорченных фото на базе SDXL: дорисовывает детали, а не просто увеличивает. Требовательна к железу, лицензия некоммерческая.

  • Восстановление старых и размытых фото
  • Увеличение снимков с дорисовкой деталей
  • Пилоты реставрации архивов
Размеры
на базе SDXL, плюс LLaVA 13B для описаний
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Поиск и RAG2024

BGE-M3

BAAI · Китай

Модель для поиска по смыслу на сотне языков. Основа RAG: бот находит нужный кусок документа перед ответом.

  • Поиск по базе документов
  • RAG для чат-бота
  • Поиск похожих обращений и дублей
Размеры
568M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Код2023–2024

Code Llama

Meta · США

Версия Llama 2, доученная на коде; есть варианты для Python и для диалога. Устарела, но много готовых дообученных версий и инструментов.

  • Автодополнение и объяснение кода
  • Генерация скриптов на Python
  • Базовая модель для дообучения под свой стек
Размеры
7B – 70B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Текст2023–2024

WizardLM, WizardCoder, WizardMath

WizardLM (Microsoft и Пекинский университет) · США / Китай

Дообучения Llama, Mistral и StarCoder методом Evol-Instruct — автоматическим усложнением инструкций. WizardLM-2 выложили в апреле 2024 и почти сразу удалили, поэтому актуальны только версии 2023 года.

  • Сложные многошаговые инструкции
  • Помощь программистам
  • Решение математических задач
Размеры
7B – 70B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Обработка фото2023

DDColor

Alibaba DAMO Academy · Китай

Окрашивание чёрно-белых фото в естественные цвета. Лёгкая модель с коммерческой лицензией, есть компактная версия tiny.

  • Окрашивание архивных фото
  • Цветные версии исторических снимков для публикаций
  • Сервис оживления семейных фото
Размеры
DDColor-T (tiny) и DDColor-L
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Видео2023

Stable Video Diffusion

Stability AI · Великобритания

Первая открытая модель Stability AI для видео: оживляет фото в ролик на 2–4 секунды. Сейчас уступает новым моделям по качеству.

  • Оживление фото товара
  • Короткие видеозаставки
  • Анимация иллюстраций
Размеры
около 1.5B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Синтез речи2023

StyleTTS 2

Колумбийский университет · США

Лёгкая модель синтеза английской речи с естественной интонацией. На её основе построены многие другие модели, например Kokoro.

  • Озвучка текстов на английском
  • Основа для дообучения своего голоса
  • Прототипы голосовых сервисов
Размеры
около 150M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Голосовые ассистенты2023

SeamlessM4T / Seamless

Meta · США

Перевод речи и текста примерно между сотней языков, включая русский: речь в текст, речь в речь, потоковый перевод с сохранением интонации.

  • Перевод речи в речь
  • Перевод и расшифровка записей
  • Потоковый перевод
Размеры
281M – 2.3B
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Перевод2023

MADLAD-400

Google · США

Переводчик Google более чем на 400 языков под свободной лицензией. Русский есть. Хорошая замена NLLB, когда нужна коммерция.

  • Перевод документов и писем
  • Перевод каталогов и описаний товаров
  • Перевод на языки стран СНГ и Азии
Размеры
3B – 10B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Синтез речи2023

Coqui XTTS

Coqui · Германия

Популярная модель клонирования голоса по короткому образцу на 17 языках, включая русский. Компания Coqui закрылась, развитие остановлено.

  • Клонирование голоса по образцу
  • Озвучка на нескольких языках
  • Исследования и прототипы
Размеры
около 470M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Обработка фото2022–2023

InSPyReNet / transparent-background

Ким Тэхун (POSTECH) · Южная Корея

Модель выделения главного объекта и готовая программа transparent-background на её основе: убирает фон с фото, видео и веб-камеры одной командой.

  • Пакетное удаление фона с фото
  • Замена фона на цвет или размытие
  • Удаление фона на видео
Размеры
небольшая (на базе Swin-B)
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCR2023

Nougat

Meta · США

Ранняя модель, переводящая научные PDF в текст с формулами. Сегодня устарела, её обходят почти все современные OCR-модели.

  • Перевод научных статей из PDF в текст с формулами
  • Оцифровка технической документации
Размеры
250M – 350M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Медицина2023

Clinical Camel

Лаборатория Бо Ванга (Университет Торонто, Vector Institute) · Канада

Ранняя медицинская модель на Llama 2 70B, обученная на диалогах по медицинским текстам. Сейчас интересна в основном для исследований. Не заменяет врача, решения принимает специалист.

  • Исследовательские пилоты по медицинским диалогам
  • Учебные материалы для персонала
  • Сравнение с новыми медицинскими моделями
Размеры
70B
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Медицина2023

RadFM

Шанхайский университет Цзяо Тун и Shanghai AI Lab · Китай

Ранняя общая модель для радиологии: понимает 2D- и 3D-снимки (КТ, МРТ) вместе с текстом. Скорее исследовательская база. Не заменяет врача, решения принимает специалист.

  • Исследовательские пилоты по разбору КТ и МРТ
  • Подсказки при разборе снимков для врача
  • Основа для своего дообучения на снимках клиники
Размеры
размер на карточке не указан
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Текст2022–2023

mGPT

Сбер (ai-forever) · Россия

Многоязычная модель Сбера на 61 язык, включая языки народов России и СНГ. Есть отдельные доучки под бурятский, якутский, татарский, башкирский, казахский и другие языки — редкость для открытых моделей.

  • Тексты на языках народов России и СНГ
  • Основа для дообучения под редкий язык
  • Черновики и шаблоны на нескольких языках
Размеры
1.3B – 13B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2023

Vicuna

LMSYS (Беркли и партнёры) · США

Одна из первых открытых чат-моделей 2023 года: LLaMA, дообученная на диалогах пользователей ChatGPT. Историческая веха, сегодня уступает любой современной модели того же размера.

  • Эксперименты и обучение команды
  • Простой чат-ассистент для тестов
  • Сравнение с новыми моделями
Размеры
7B – 33B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Обработка фото2022–2023

HAT

XPixel Group (Шэньчжэньский институт передовых технологий АН Китая и др.) · Китай

Увеличение фото на трансформере, точнее SwinIR на тонких деталях. Есть версии для реальных снимков с шумом и лёгкая HAT-S.

  • Увеличение фото товаров и интерьеров
  • Подготовка изображений к печати
  • Повышение чёткости архивных снимков
Размеры
9M – 40M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Аватары2023

SadTalker

Сианьский университет Цзяотун и Tencent AI Lab · Китай

Старая лёгкая модель говорящей головы: одно фото и аудио превращаются в видео. Работает на слабом железе, но качество заметно ниже новых.

  • Говорящее фото для приветствия
  • Простые озвученные аватары
Размеры
меньше 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2023

ruGPT-3.5

Сбер (ai-forever) · Россия

Базовая русскоязычная модель Сбера на 13 млрд параметров, из дообученной версии которой вырос GigaChat. Продолжает тексты на русском и английском, контекст всего 2048 токенов; сегодня интересна как основа для узкого дообучения.

  • Основа для дообучения под узкую русскую задачу
  • Генерация шаблонных русских текстов
  • Эксперименты с русскоязычными моделями без ограничений лицензии
Размеры
13B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Синтез речи2023

Bark

Suno · США

Одна из первых открытых моделей, которая озвучивает текст с интонациями, смехом и паузами. Поддерживает около десятка языков, включая русский. Сейчас устарела.

  • Черновая озвучка роликов
  • Прототипы голосовых сервисов
  • Звуковые эффекты в речи
Размеры
около 300M – 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
3D2022–2023

Point-E / Shap-E

OpenAI · США

Ранние открытые модели OpenAI, которые делают 3D-объект по тексту или картинке за секунды. Качество простое, зато быстро и легко запускается.

  • Черновые 3D-макеты по описанию
  • Быстрые прототипы объектов для игр и AR
  • Учебные и исследовательские пилоты по 3D
Размеры
40M – 1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Обработка фото2023

StableSR

S-Lab, Наньянский технологический университет · Сингапур

Одна из первых моделей увеличения фото на базе Stable Diffusion: восстанавливает реалистичные детали. Лицензия некоммерческая.

  • Увеличение фото с дорисовкой деталей
  • Исследовательские пилоты реставрации
  • Сравнение с классическими апскейлерами
Размеры
на базе SD 2.1
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Картинки2023

DeepFloyd IF

DeepFloyd (Stability AI) · Великобритания

Ранняя модель, которая одной из первых научилась аккуратно писать текст на картинках. Сейчас интересна скорее как история, развитие остановлено.

  • Исследовательские эксперименты
  • Прототипы картинок с надписями
Размеры
0.4B – 4.3B
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
Обработка фото2022–2023

CodeFormer

S-Lab, Наньянский технологический университет · Сингапур

Популярная реставрация лиц на старых и размытых фото, работает и с видео. Есть режимы дорисовки и окрашивания лица. Лицензия некоммерческая.

  • Восстановление лиц на старых фото
  • Улучшение лиц на видео низкого качества
  • Пилоты реставрации семейных архивов
Размеры
небольшая, до 0.1B
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Текст2022–2023

Flan-T5 и Flan-UL2

Google · США

Компактные модели «вход-выход», обученные выполнять инструкции. До сих пор используются как дешёвая основа для классификации, извлечения и коротких ответов.

  • Классификация обращений и документов
  • Извлечение полей из текста
  • Короткие ответы и пересказ
Размеры
80M – 20B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Перевод2022–2023

NLLB-200

Meta · США

Переводчик на 200 языков, включая редкие и малые. Русский есть. Сильна по охвату языков, но лицензия запрещает коммерческое использование.

  • Перевод текстов между 200 языками
  • Перевод на редкие языки, где нет других моделей
  • Сравнение качества при выборе переводчика
Размеры
600M – 3.3B (и 54B MoE)
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Текст2022–2023

Pythia и GPT-NeoX

EleutherAI · США

Полностью открытые модели некоммерческой лаборатории EleutherAI: GPT-NeoX-20B и серия Pythia с опубликованными промежуточными снимками обучения.

  • Базовая модель для дообучения
  • Исследование поведения моделей
  • Простая генерация и дополнение текста
Размеры
70M – 20B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2022

OPT

Meta · США

Ранняя открытая серия Meta, повторяющая по размерам GPT-3. Устарела, полезна для исследований и сравнения.

  • Исследовательские эксперименты
  • Обучение специалистов
  • Сравнение с современными моделями
Размеры
125M – 66B (175B по запросу)
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Текст2022

BLOOM

BigScience (Hugging Face и сообщество) · Франция

Одна из первых больших открытых моделей, обученная сообществом из сотен исследователей на 46 языках. Сегодня интересна скорее как историческая веха.

  • Генерация и перевод текстов на многих языках
  • Эксперименты и обучение команды
  • Базовая модель для дообучения под узкую задачу
Размеры
560M – 176B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Обработка фото2021–2022

Real-ESRGAN

Tencent ARC Lab · Китай

Классика увеличения фото в 2–4 раза с очисткой от шума и артефактов сжатия. Лёгкая, работает даже на процессоре. Есть версии для рисунков и аниме.

  • Увеличение старых и мелких фото товаров
  • Очистка картинок от артефактов сжатия
  • Подготовка изображений к печати
Размеры
около 17M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Обработка фото2021–2022

GFPGAN

Tencent ARC Lab · Китай

Проверенная реставрация лиц на старых и сжатых фото с коммерческой лицензией. Часто работает в паре с Real-ESRGAN, самые ходовые версии 1.3 и 1.4.

  • Восстановление лиц на старых фото
  • Улучшение аватаров и фото профиля
  • Реставрация в фотосалоне или онлайн-сервисе
Размеры
небольшая, до 0.1B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Разбор текста2019–2022

XLM-RoBERTa

Meta · США

Классический многоязычный энкодер на 100 языков, включая русский. Основа многих моделей тональности, NER и эмбеддингов, в том числе BGE-M3.

  • Определение тональности отзывов на разных языках
  • Извлечение имён и организаций после дообучения
  • Классификация обращений
Размеры
270M – 10.7B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Разбор текста2021

DeBERTa-v3 и mDeBERTa-v3

Microsoft · США

Проверенный временем энкодер, на котором построено множество классификаторов и NER-моделей (в том числе GLiNER). Многоязычная mDeBERTa-v3 понимает русский.

  • Классификация отзывов по тональности
  • Извлечение сущностей после дообучения
  • Проверка, следует ли вывод из текста
Размеры
70M – 435M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Разбор текста2021

rubert-tiny

Давид Дале (cointegrated) · Россия

Очень маленький русско-английский BERT, работает быстро на обычном процессоре. Есть готовые дообученные версии для тональности, токсичности и эмоций.

  • Определение тональности отзывов
  • Фильтр грубых сообщений в чате
  • Быстрая классификация обращений
Размеры
12M – 29M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Обработка фото2021

LaMa

Samsung AI Center Москва (вместе со Сколтехом) · Россия

Удаление лишних объектов, надписей и водяных знаков с фото с аккуратной дорисовкой фона. Лёгкая и быстрая, до сих пор стандарт для такой задачи.

  • Удаление ценников, людей и мусора с фото
  • Чистка фото интерьеров и недвижимости
  • Удаление надписей и дат с архивных снимков
Размеры
около 51M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Обработка фото2021

SwinIR

ETH Zurich · Швейцария

Модель на трансформере для увеличения, шумоподавления и очистки фото от артефактов JPEG. Лёгкая и проверенная, часто стоит внутри других систем.

  • Увеличение фото
  • Шумоподавление снимков
  • Очистка от артефактов сжатия
Размеры
около 12M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Перевод2020–2021

M2M-100

Meta · США

Ранний переводчик Meta, который переводит напрямую между 100 языками, без английского посередине. Русский есть. Старый, но лёгкий и свободный.

  • Перевод между любой парой из 100 языков
  • Быстрый черновой перевод на слабом железе
  • Основа для дообучения под свою тематику
Размеры
418M – 12B
Железо
от: Ноутбук
Можно в коммерциюПодробнее

Нужна модель под вашу задачу?

Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.

  1. ПодберуМодель и размер под задачу и бюджет на железо
  2. ПоставлюНа ваш сервер или в закрытый контур, с API
  3. ДообучуНа ваших данных или подключу базу знаний
  4. ВстроюВ CRM, 1С, бота, сайт или рабочий чат
Обсудить внедрение