Картинки2025–2026
Alibaba · Китай
Генерация и редактирование картинок, в том числе с текстом на изображении. Ранние версии можно в коммерцию, свежая 2.1 — только некоммерческая.
- Инфографика для карточек товаров
- Правка фото по текстовой команде
- Рекламные креативы
- Размеры
- 7B – 20B
- Железо
- от: 1 видеокарта
Медицина2023–2026
FreedomIntelligence (Китайский университет Гонконга, Шэньчжэнь) · Китай
Большое семейство медицинских моделей: чат, версия со снимками, рассуждающая HuatuoGPT-o1 и новая HuatuoGPT-3 на Qwen3. Не заменяет врача, решения принимает специалист.
- Черновики выписок для проверки врачом
- Поиск по медицинской литературе
- Подсказки при разборе снимков для врача (Vision)
- Размеры
- 7B – 72B
- Железо
- от: Ноутбук
Речь в текст2025–2026
Microsoft · США
Речевые модели Microsoft: синтез длинных диалогов на несколько голосов, быстрый синтез для живого общения и распознавание длинных записей с разделением по говорящим, в том числе на русском.
- Расшифровка длинных встреч с разметкой говорящих
- Озвучка подкастов и диалогов
- Голос для ассистентов в реальном времени
- Размеры
- 0.5B – 9B
- Железо
- от: Ноутбук
Музыка и звук2025–2026
M-A-P и HKUST · Китай
Генерация полноценных песен с вокалом и аккомпанементом по тексту и описанию стиля: английский, китайский, японский, корейский.
- Песни и джинглы по тексту
- Демо-версии композиций
- Музыка для роликов
- Размеры
- 0.5B – 7B
- Железо
- от: 1 видеокарта
Музыка и звук2026
HeartMuLa Team · не указана
Открытая модель генерации песен с вокалом на китайском, английском, японском, корейском и испанском, плюс кодек и модель расшифровки текста песен.
- Песни и джинглы по тексту
- Музыка для роликов
- Расшифровка текста песен
- Размеры
- 3B
- Железо
- от: 1 видеокарта
Текст2023–2026
DeepSeek · Китай
Флагманская линия DeepSeek: от первых 7B/67B до V4-Pro на 1,6 трлн параметров. Уровень закрытых моделей при открытой MIT-лицензии; V4.1-Flash понимает картинки и держит контекст до 1 млн токенов.
- Ассистент для сотрудников на своём сервере
- Разбор длинных договоров и отчётов
- Агенты, которые работают с инструментами и API
- Размеры
- 7B – 1.6T-A49B
- Железо
- от: Ноутбук
Текст2023–2026
Shanghai AI Laboratory · Китай
Модели Шанхайской лаборатории ИИ. Ранняя линия InternLM — универсальная, новая Intern-S1/S2 — научная: понимает формулы, молекулы, графики и картинки.
- Помощник исследователя: статьи, формулы, данные
- Разбор научных и технических документов
- Корпоративный чат на малых моделях
- Размеры
- 1.8B – около 1T
- Железо
- от: Ноутбук
Текст2025–2026
Xiaomi · Китай
Модели Xiaomi для рассуждений и агентов: от компактной MiMo-7B до MiMo-V2.6-Pro на 1 трлн параметров. Flash-версии задействуют всего 15 млрд параметров на токен.
- Логические и расчётные задачи
- Агенты с инструментами
- Помощь программистам
- Размеры
- 7B – 1T-A42B
- Железо
- от: Ноутбук
Текст2024–2026
Сбер · Россия
Открытые модели Сбера, обученные с упором на русский язык: хорошо пишут и понимают по-русски, знают местные реалии. Есть лёгкая 10B-A1.8B и флагманы до 702B, всё под MIT.
- Русскоязычный ассистент для сотрудников на своём сервере
- Ответы клиентам и разбор обращений на русском
- Работа с договорами и внутренними регламентами
- Размеры
- 10B-A1.8B – 702B-A36B
- Железо
- от: Ноутбук
Текст2022–2026
Яндекс · Россия
Модели Яндекса, обученные с нуля с упором на русский язык и российские реалии. Новая AliceAI-Foundation 80B-A3B — базовая модель под Apache 2.0, её дообучают под свои задачи.
- Русскоязычный ассистент и чат-бот
- Ответы на вопросы по базе знаний компании
- Основа для дообучения под свою отрасль
- Размеры
- 8B – 100B
- Железо
- от: Ноутбук
Текст2024–2026
Cohere Labs · Канада
Многоязычные модели исследовательского крыла Cohere, от 23 до 100+ языков. Tiny Aya 2026 года на 3.3B работает на обычном ПК, но только некоммерчески.
- Перевод и переписка на редких языках
- Многоязычный чат-ассистент
- Разбор изображений с текстом (Vision)
- Размеры
- 3.3B – 35B
- Железо
- от: Ноутбук
Текст2023–2026
Alibaba · Китай
Семейство языковых моделей с сильным русским языком: от маленьких версий для ноутбука до флагмана уровня коммерческих API.
- Чат-бот и ассистент по базе знаний
- Ответы на письма и обращения
- Разбор и классификация документов
- Размеры
- 0,6B – 2,4T
- Железо
- от: Ноутбук
Видео2025–2026
Sand AI · Китай
Видео, которое генерируется по кускам друг за другом, поэтому ролик можно продлевать бесконечно. MAGI-2 делает видео сразу со звуком.
- Длинные ролики с продолжением
- Видео со звуком
- Оживление изображений
- Размеры
- 4.5B – 114B-A6B
- Железо
- от: 1 видеокарта
Видео2025–2026
NVIDIA · США
Лёгкая и быстрая видеомодель NVIDIA. Выдаёт 720p-ролики на одной видеокарте, есть версия на 4 шага для быстрой генерации.
- Быстрые ролики для соцсетей
- Массовая генерация видео
- Видео из картинки
- Размеры
- 2B – 5B
- Железо
- от: 1 видеокарта
Компьютерное зрение2024–2026
Microsoft Research · США
Восстанавливает 3D-геометрию сцены по одной фотографии: глубину в метрах, облако точек и нормали поверхностей.
- Замеры помещений и объектов по фото
- 3D-облако точек из снимка
- Подготовка данных для роботов и AR
- Размеры
- ViT-S – ViT-G
- Железо
- от: Ноутбук
Поиск и RAG2024–2026
Сбер (SberDevices) · Россия
Эмбеддинги Сбера, заточенные под русский язык: одни из лучших на русскоязычных тестах поиска. FRIDA компактная, Giga-Embeddings мощнее.
- Поиск по русскоязычным документам
- RAG для чат-ботов на русском
- Классификация обращений и отзывов
- Размеры
- 480M – 10B-A1.8B
- Железо
- от: Ноутбук
Прогнозы2024–2026
Google · США
Готовая модель прогнозов Google: строит прогноз по любому временному ряду без обучения на ваших данных.
- Прогноз продаж и спроса
- Планирование закупок и запасов
- Прогноз нагрузки и трафика
- Размеры
- 200M – 500M
- Железо
- от: Ноутбук
Роботы2025–2026
GigaAI · Китай
Модель управления роботами, обученная в основном на синтетических данных из модели мира. Позволяет меньше тратить на сбор данных с реальных роботов.
- Управление манипулятором
- Дообучение на малом объёме своих данных
- Пилоты сортировки и сборки
- Размеры
- 3.5B
- Железо
- от: 1 видеокарта
Речь в текст2024–2026
Moonshine AI (Useful Sensors) · США
Очень маленькие и быстрые модели распознавания речи для телефонов, планшетов и встраиваемых устройств. Вторая версия работает потоково и выдаёт текст, пока человек ещё говорит.
- Голосовое управление устройствами
- Распознавание на телефоне без интернета
- Живые субтитры
- Размеры
- 27M – 245M
- Железо
- от: Ноутбук
Речь в текст2025–2026
IBM · США
Речевые модели IBM для распознавания и перевода речи на английском и нескольких европейских языках и японском. Рассчитаны на корпоративное использование.
- Расшифровка деловых встреч
- Перевод речи в текст на другом языке
- Голосовые ассистенты
- Размеры
- 470M – 8B
- Железо
- от: Ноутбук
Синтез речи2025–2026
bilibili · Китай
Синтез речи с клонированием голоса и точным контролем длительности, удобен для дубляжа видео. Управляет эмоциями отдельно от тембра.
- Дубляж видео с попаданием в тайминг
- Клонирование голоса
- Эмоциональная озвучка
- Размеры
- около 1B – 2B
- Железо
- от: Ноутбук
Текст2023–2026
Zhipu AI (Z.ai) · Китай
Одна из старейших китайских открытых линий: от ChatGLM-6B до GLM-5.3. Сильна в агентных задачах и программировании; GLM-5.3-Flash понимает картинки и выходит под MIT.
- Корпоративный чат-ассистент
- Агенты для рутинных офисных задач
- Помощь программистам
- Размеры
- 1.5B – 744B-A40B
- Железо
- от: Ноутбук
Текст2024–2026
Tencent · Китай
Языковые модели Tencent: от малых 0.5B–7B до Hy4-preview на 770 млрд параметров. С 2026 года линия переименована в Hy, а новые версии вышли под Apache 2.0.
- Корпоративный ассистент
- Перевод и работа с многоязычными текстами
- Агенты с инструментами
- Размеры
- 0.5B – 770B-A49B
- Железо
- от: Ноутбук
Текст2025–2026
Ant Group (inclusionAI) · Китай
Семейство Ant Group: Ling — обычные модели, Ring — рассуждающие. Есть и триллионные флагманы, и экономичная Ling-3.0-tiny, которой хватает 1,3 млрд активных параметров.
- Корпоративный ассистент
- Агенты для офисных процессов
- Финансовая аналитика (есть версия Fin)
- Размеры
- 7.9B-A1.3B – 1T
- Железо
- от: Ноутбук
Текст2024–2026
NVIDIA · США
Модели NVIDIA для агентов и рассуждений, заточенные под быстрый запуск на её видеокартах. Nemotron 3 это гибрид Mamba и MoE от 4B до 550B.
- Агенты с вызовом инструментов
- Задачи с рассуждением и расчётами
- Ответы по длинным документам
- Размеры
- 4B – 550B-A55B
- Железо
- от: Ноутбук
Текст2024–2026
IBM · США
Корпоративные модели IBM с прозрачными данными обучения и сертификацией ISO 42001. Granite 4 это гибрид Mamba и трансформера, экономный по памяти.
- Ответы по внутренним документам (RAG)
- Вызов инструментов и работа в агентах
- Извлечение данных и классификация
- Размеры
- 350M – 34B
- Железо
- от: Ноутбук
Текст2025–2026
Liquid AI · США
Модели новой архитектуры для работы прямо на устройстве: быстрые на обычном процессоре и в телефоне. Есть версии для извлечения данных, RAG и инструментов.
- Ассистент на ноутбуке или телефоне без интернета
- Извлечение данных из документов
- Вызов инструментов в приложениях
- Размеры
- 230M – 24B-A2B
- Железо
- от: Ноутбук
Текст2026
Meta Superintelligence Labs · США
Открытая модель Meta для агентов на доступном железе: дистиллирована из закрытой Muse Spark, понимает текст и картинки, обучена на 100+ языках.
- Агенты с вызовом инструментов
- Разбор скриншотов, графиков и документов
- Многоязычный ассистент
- Размеры
- 30B
- Железо
- от: 1 видеокарта
Разбор текста2024–2026
Урчаде Заратиана и Fastino AI · Франция / США
Находит в тексте нужные сущности без обучения: просто перечисляете, что искать (имя, сумма, дата). GLiNER2 заодно классифицирует текст. Многоязычные версии понимают русский.
- Извлечение имён, сумм и дат из писем и договоров
- Разбор заявок на поля CRM
- Классификация обращений по темам
- Размеры
- около 50M – 500M
- Железо
- от: Ноутбук
Документы и OCR2026
TeleAI (China Telecom) · Китай
Новая лёгкая модель для разбора документов, на момент выхода лидер теста OmniDocBench v1.6. Хорошо справляется со снятыми на телефон и помятыми страницами. Языки в карточке — китайский, английский, японский.
- Распознавание счетов и накладных, снятых на телефон
- Распознавание таблиц и формул
- Перевод документов в Markdown для RAG
- Размеры
- около 1.2B
- Железо
- от: Ноутбук
Видео2025–2026
Alibaba · Китай
Генерация видео по тексту и по картинке. Младшая версия запускается на игровой видеокарте. После 2.2 базовые модели открыто не выходят, только прикладные.
- Короткие рекламные ролики
- Оживление фото товара
- Видео для соцсетей
- Размеры
- 1,3B – 14B
- Железо
- от: 1 видеокарта
Код2025–2026
Kwaipilot (Kuaishou) · Китай
Модели Kuaishou для агентной разработки, обученные решать реальные задачи в репозиториях. KAT-Coder-V2.5-Dev (35B, активны 3B) — открытая версия их закрытого флагмана.
- Агент, исправляющий задачи в репозитории
- Генерация и рефакторинг кода
- Автоматизация рутинных задач разработки
- Размеры
- 32B – 72B, 35B-A3B
- Железо
- от: 1 видеокарта
Картинки2022–2026
Сбер (Kandinsky Lab) · Россия
Российское семейство генерации картинок и видео от Сбера. Хорошо понимает запросы на русском и российский культурный контекст, открыто под MIT.
- Картинки по описанию на русском
- Короткие рекламные ролики из текста или фото
- Редактирование изображений по инструкции
- Размеры
- 2B – 19B
- Железо
- от: 1 видеокарта
Картинки2025–2026
lodestones (независимый разработчик) · нет данных
Общественная модель, переобученная из FLUX.1-schnell с упрощённой архитектурой. Без цензуры стилей, популярна как база для дообучения.
- База для дообучения своих стилей
- Художественные иллюстрации
- Картинки для игр
- Размеры
- 4B – 8.9B
- Железо
- от: 1 видеокарта
Видео2024–2026
Lightricks · Израиль
Быстрая видеомодель, которая с LTX-2 генерирует видео сразу со звуком и речью. Можно управлять камерой и позой, есть облегчённые версии.
- Рекламные ролики со звуком
- Видео из фото товара
- Озвученные сцены для соцсетей
- Размеры
- 2B – 22B
- Железо
- от: 1 видеокарта
Видео2026
MiniMax · Китай
Открытые веса видеомодели Hailuo от MiniMax. Крупная модель на 33B, делает видео по тексту и картинке, но требует нескольких серверных видеокарт.
- Кинематографичные рекламные ролики
- Видео по тексту и картинке
- Сложные сцены с движением
- Размеры
- 33B + кодировщик 32B
- Железо
- от: Кластер
Поиск и RAG2025–2026
NVIDIA · США
Эмбеддинги NVIDIA для поиска и RAG. Nemotron-3-Embed 2026 года вышли под свободной лицензией OpenMDW и работают на многих языках.
- Поиск по корпоративным документам
- RAG для чат-ботов и ассистентов
- Поиск по картинкам и страницам (VL-версии)
- Размеры
- 1B – 8B
- Железо
- от: Ноутбук
Роботы2025–2026
NVIDIA · США
Модели «мира» для роботов и беспилотников: генерируют реалистичное видео физических сцен и предсказывают действия. Cosmos 3 объединяет понимание, генерацию и управление.
- Синтетические видео для обучения роботов и беспилотников
- Проверка сценариев в симуляции
- Управление роботом (Policy-версии)
- Размеры
- 2B – 65B
- Железо
- от: 1 видеокарта
Роботы2026
Ant Group (Robbyant) · Китай
Модель управления роботами от Ant Group, обученная на большом объёме данных с реальных роботов. Версия 2.0 работает с разными типами манипуляторов.
- Управление двуруким манипулятором
- Дообучение под свою операцию
- Пилоты сборки и сортировки
- Размеры
- 4B – 6B
- Железо
- от: 1 видеокарта
Роботы2026
Xiaomi · Китай
Открытые модели управления роботами от Xiaomi. Robotics-1 рассчитана на бытовые и кухонные задачи, U0 объединяет понимание сцены и действия.
- Управление манипулятором по команде
- Бытовые и сервисные сценарии
- Основа для дообучения
- Размеры
- 4B – 5B
- Железо
- от: 1 видеокарта
Речь в текст2024–2026
Сбер · Россия
Модели Сбера для распознавания русской речи, одни из самых точных для русского языка. Есть распознавание эмоций, версия v3 с пунктуацией и многоязычная версия (русский, казахский, киргизский, узбекский).
- Расшифровка звонков на русском
- Протоколы совещаний
- Голосовое управление сервисами
- Размеры
- 220M – 600M
- Железо
- от: Ноутбук
Текст2025–2026
Moonshot AI · Китай
Сверхкрупные MoE-модели Moonshot для агентной работы. K3 на 2,8 трлн параметров — самая большая открытая модель на момент выхода, с контекстом до 1 млн токенов и пониманием картинок.
- Многошаговые агенты: поиск, сбор данных, отчёты
- Глубокий анализ документов
- Помощь программистам
- Размеры
- 16B-A3B – 2.8T-A104B
- Железо
- от: 1 видеокарта
Текст2025–2026
Meituan · Китай
Модели Meituan (крупнейший сервис доставки Китая). LongCat-Flash динамически меняет объём вычислений под сложность запроса; LongCat-2.0 — 1,6 трлн параметров под MIT.
- Агенты для заказов и сервисных процессов
- Корпоративный ассистент
- Разбор длинных документов
- Размеры
- 69B – 1.6T-A48B
- Железо
- от: 1 видеокарта
Текст2024–2026
LG AI Research · Южная Корея
Корейско-английские модели LG. Большая часть линии некоммерческая, но флагман K-EXAONE 2.0 на 750 млрд параметров вышел под Apache 2.0.
- Корпоративный ассистент
- Работа с корейскими и английскими текстами
- Разбор документов и картинок (4.5)
- Размеры
- 1.2B – 750B-A37B
- Железо
- от: Ноутбук
Текст2023–2026
Upstage · Южная Корея
Модели корейской Upstage. Solar Open 2 рассчитана на офисную работу с документами: 250 млрд параметров, из них активны 15 млрд, языки — английский, корейский, японский.
- Работа с офисными документами
- Агенты для рутинных задач
- Помощь программистам
- Размеры
- 10.7B – 250B-A15B
- Железо
- от: 1 видеокарта
Текст2025–2026
Kakao · Южная Корея
Компактные корейско-английские модели Kakao. Kanana 2 30B-A3B работает быстро за счёт MoE, малые версии на 1–3B подходят для обычного ПК.
- Чат-бот поддержки
- Классификация обращений
- Лёгкий ассистент на своём ПК
- Размеры
- 1.3B – 30B-A3B
- Железо
- от: Ноутбук
Текст2025–2026
Swiss AI (ETH Zurich, EPFL, CSCS) · Швейцария
Государственная открытая модель Швейцарии: открыты веса, данные и рецепт, более 1000 языков в обучении. Версия 1.5 понимает изображения.
- Многоязычный ассистент
- Ответы по документам
- Разбор изображений и сканов (v1.5)
- Размеры
- 0.5B – 70B
- Железо
- от: Ноутбук
Текст2026
Thinking Machines Lab · США
Флагманские открытые модели лаборатории Миры Мурати: принимают текст, изображения и аудио. Большие MoE, требуют нескольких видеокарт.
- Корпоративный ассистент уровня флагмана
- Разбор документов, изображений и аудио
- Помощь в программировании
- Размеры
- 276B-A12B, 975B-A41B
- Железо
- от: Кластер
Код2026
Poolside · США
Модели для агентного программирования: самостоятельно правят код в репозитории. Младшая XS запускается на Mac с 36 ГБ памяти, у S 2.1 контекст 1M токенов.
- Агент-программист для внутренней разработки
- Исправление ошибок и доработка кода
- Работа с большими кодовыми базами
- Размеры
- 33B-A3B – 225B-A23B
- Железо
- от: 1 видеокарта
Картинка + текст2024–2026
Alibaba (AIDC-AI) · Китай
Модели зрения от международного подразделения Alibaba с сильным чтением текста и таблиц. В линейке есть MoE Ovis2.6 и отдельные компактные OvisOCR для документов.
- Извлечение данных из счетов, договоров и накладных
- Распознавание таблиц
- Ответы на вопросы по фото и графикам
- Размеры
- 0.9B – 80B-A3B
- Железо
- от: Ноутбук
Документы и OCR2025–2026
Tencent · Китай
Лёгкая OCR-модель Tencent: разбор документов, поиск текста на фото, извлечение полей и перевод текста с картинок. Версия 1.5 быстрее и запускается на обычном ПК.
- Извлечение полей из счетов и накладных
- Распознавание таблиц и формул
- Перевод текста на фотографиях и сканах
- Размеры
- 1B
- Железо
- от: Ноутбук
Код2025–2026
JetBrains · Чехия
Модели JetBrains для быстрого автодополнения кода. Mellum2 (12B, активны 2.5B) уже полноценный помощник: пишет и правит код, вызывает инструменты, рассуждает.
- Быстрое автодополнение кода на своём сервере
- Помощник разработчика без отправки кода в облако
- Дообучение на коде компании
- Размеры
- 4B – 12B-A2.5B
- Железо
- от: Ноутбук
Картинки2026
Krea · США
Модель картинок на 12B с упором на реализм без глянцевого «ИИ-вида». Turbo-версия выдаёт 2K-картинку за пару секунд.
- Реалистичные фото для рекламы
- Картинки высокого разрешения
- Дообучение стилей
- Размеры
- 12B
- Железо
- от: 1 видеокарта
Картинки2026
Ideogram · Канада
Открытые веса модели Ideogram, известной точной типографикой. Под некоммерческой лицензией: для бизнеса подходит только для тестов.
- Тестирование генерации с текстом
- Исследования и прототипы
- Размеры
- около 9B
- Железо
- от: 1 видеокарта
Математика и рассуждения2025–2026
Open Thoughts (Стэнфорд, Беркли и другие университеты) · США
Полностью открытые рассуждающие модели: выложены и веса, и обучающие данные. Новые версии OpenThinkerAgent умеют выполнять многошаговые задачи.
- Расчёты и проверка формул
- Сложная аналитика с пошаговым разбором
- Проверка логики регламентов
- Размеры
- 1.5B – 32B
- Железо
- от: Ноутбук
Компьютерное зрение2025–2026
Roboflow · США
Детектор объектов в реальном времени, открытая замена YOLO без AGPL. Умеет сегментацию (контуры объектов), с 2026 года — ключевые точки.
- Детекция объектов на видео и фото
- Точные контуры деталей и дефектов
- Дообучение под свои классы объектов
- Размеры
- Nano – 2XL
- Железо
- от: Ноутбук
Прогнозы2025–2026
NXAI · Австрия
Компактная модель прогнозов на архитектуре xLSTM, лидер открытых тестов при малом размере. Быстро работает на обычном процессоре.
- Прогноз спроса и продаж
- Прогноз потребления энергии
- Прогнозы на слабом железе и на месте
- Размеры
- около 35M – 82M
- Железо
- от: Ноутбук
Речь в текст2026
Alibaba (Qwen) · Китай
Модели распознавания речи от команды Qwen на 50+ языков, включая русский. Хорошо справляются с шумом, пением и акцентами.
- Расшифровка звонков и встреч
- Субтитры к видео
- Распознавание на нескольких языках
- Размеры
- 0.6B – 1.7B
- Железо
- от: Ноутбук
Речь в текст2026
Cohere · Канада
Модель распознавания речи от Cohere на 14 языков (русского в списке нет), отдельная версия для арабского. Рассчитана на точную расшифровку деловых записей.
- Расшифровка встреч и интервью
- Субтитры
- Поиск по аудиоархиву
- Размеры
- 2B
- Железо
- от: Ноутбук
Синтез речи2025–2026
Boson AI · США
Выразительный синтез речи и диалогов с клонированием голоса, плюс модели распознавания. Третья версия синтеза поддерживает около 100 языков, включая русский, но некоммерческая.
- Выразительная озвучка роликов
- Озвучка диалогов
- Клонирование голоса
- Размеры
- около 3B – 8B
- Железо
- от: 1 видеокарта
Синтез речи2025–2026
Zyphra · США
Синтез речи с клонированием голоса и тонкой настройкой эмоций, скорости и высоты голоса.
- Клонирование голоса
- Эмоциональная озвучка
- Озвучка роликов
- Размеры
- около 1.6B
- Железо
- от: Ноутбук
Музыка и звук2025–2026
ACE Studio и StepFun · Китай
Быстрая генерация песен с вокалом на 19 языках, включая русский: полная песня за секунды, правка отдельных фрагментов и смена стиля.
- Песни и джинглы для рекламы
- Фоновая музыка для роликов
- Демо-версии композиций
- Размеры
- около 2B – 4B
- Железо
- от: Ноутбук
Текст2025–2026
MiniMax · Китай
Крупные MoE-модели с очень длинным контекстом (до 1 млн токенов у Text-01 и M3). M3 — мультимодальная, понимает картинки. Лицензии сильно различаются от версии к версии.
- Анализ больших архивов документов за один запрос
- Агенты с инструментами
- Помощь программистам
- Размеры
- 230B-A10B – 456B-A46B
- Железо
- от: Кластер
Модерация и безопасность2024–2026
Сообщество GLiNER (Fastino, Knowledgator, NVIDIA и др.) · США
Маленькие модели на основе GLiNER для поиска персональных данных: паспортов, телефонов, счетов, адресов. Типы данных задаются словами. Русский официально не заявлен.
- Маскирование персональных данных перед облачным ИИ
- Поиск паспортных данных и реквизитов в документах
- Проверка выгрузок на утечки
- Размеры
- около 200M – 500M
- Железо
- от: Ноутбук
Картинка + текст2024–2026
Moondream (M87 Labs) · США
Небольшая и быстрая модель зрения для продуктовых задач: ответы на вопросы, поиск и указание объектов, подписи. Moondream 3.1 — MoE на 9B с 2B активных.
- Поиск объектов и подсчёт на фото
- Проверка фото из полевых отчётов
- Подписи и теги для каталога
- Размеры
- 2B – 9B-A2B
- Железо
- от: Ноутбук
Картинки2025–2026
HiDream.ai · Китай
Открытые модели картинок под MIT: генерация (I1), редактирование по инструкции (E1) и единая модель O1-Image, которая делает и то и другое.
- Генерация картинок по описанию
- Правка изображений словами
- Вариации продуктовых фото
- Размеры
- около 9B – 17B
- Железо
- от: 1 видеокарта
Аватары2025–2026
Meituan · Китай
Говорящие люди по аудио на базе LongCat-Video. Версия 1.5 доведена до продакшна: стабильные длинные ролики на китайском и английском.
- Видео с ведущим новостей или курса
- Промо-ролики с говорящим персонажем
- Пение и озвучка
- Размеры
- на базе LongCat-Video 13.6B
- Железо
- от: 1 видеокарта
Медицина2023–2026
EPFL · Швейцария
Открытые медицинские модели швейцарского EPFL, которые дообучают поверх разных базовых моделей по клиническим руководствам. Не заменяет врача, решения принимает специалист.
- Ответы персоналу по клиническим руководствам
- Черновики выписок для проверки врачом
- Поиск по медицинской литературе
- Размеры
- 2B – 70B
- Железо
- от: Ноутбук
3D2024–2026
VAST (TripoSR — вместе со Stability AI) · Китай
Семейство VAST: 3D-модель по одной фотографии. TripoSR работает меньше секунды, TripoSG даёт более чистую геометрию, TripoSplat строит сцену из гауссовых точек.
- 3D-модель товара по фото
- Заготовки объектов для игр и AR
- Быстрый 3D-прототип для печати
- Размеры
- до 1.5B
- Железо
- от: Ноутбук
Поиск и RAG2023–2026
Jina AI · Германия
Сильные многоязычные эмбеддинги с длинным контекстом, v5-omni понимает текст, картинки и аудио. Свежие версии открыты только для некоммерческого использования.
- Поиск по документам на многих языках
- Поиск по картинкам и сканам
- Классификация и кластеризация
- Размеры
- 33M – 3.8B
- Железо
- от: Ноутбук
Роботы2025–2026
Ai2 (Allen Institute for AI) · США
Полностью открытая модель управления роботом, которая сначала «рассуждает» о пространстве и траектории, а потом действует. Ход рассуждений можно проверить.
- Управление манипулятором с объяснимыми шагами
- Дообучение под свой робот
- Исследовательские пилоты
- Размеры
- 5B – 8B
- Железо
- от: 1 видеокарта
Текст2023–2026
Cognitive Computations (Эрик Хартфорд) · США
Дообучения без встроенной цензуры поверх Llama, Mistral, Qwen и других: модель выполняет почти любые запросы. Ответственность за фильтрацию и модерацию полностью на том, кто её внедряет, — без своего фильтра клиентам её не показывать.
- Ассистент, который не отказывает в законных, но «острых» темах
- Внутренние инструменты под жёстким системным промптом
- Ролевые и творческие сценарии
- Размеры
- 0.5B – 405B
- Железо
- от: Ноутбук
Речь в текст2023–2026
NVIDIA · США
Быстрые модели распознавания речи от NVIDIA, в том числе потоковые для работы в реальном времени. Parakeet TDT v3 и Nemotron 3.5 ASR понимают русский.
- Расшифровка звонков и совещаний
- Субтитры к видео
- Голосовой ввод в реальном времени
- Размеры
- 110M – 2.5B
- Железо
- от: Ноутбук
Синтез речи2025–2026
Resemble AI · США
Синтез речи с клонированием голоса и настройкой эмоциональности. Многоязычная версия поддерживает 23 языка, включая русский; Turbo и Flash ускорены для живого диалога.
- Голос для бота и ассистента
- Клонирование фирменного голоса
- Озвучка роликов
- Размеры
- около 350M – 500M
- Железо
- от: Ноутбук
Синтез речи2025–2026
OpenMOSS (Фуданьский университет) · Китай
Семейство синтеза речи: озвучка диалогов на несколько голосов (TTSD), быстрый синтез для живого общения и крошечная Nano. Версия 1.5 поддерживает 30+ языков, включая русский.
- Озвучка подкастов и диалогов
- Голос для ассистента
- Клонирование голоса
- Размеры
- 100M – 8.5B
- Железо
- от: Ноутбук
Музыка и звук2024–2026
Stability AI · Великобритания
Генерация коротких музыкальных фрагментов и звуковых эффектов по описанию. Третья версия разделена на модели для музыки и для звуков.
- Звуковые эффекты для роликов и игр
- Фоновая музыка и джинглы
- Звуки для интерфейсов
- Размеры
- около 0.5B – 2.3B
- Железо
- от: Ноутбук
Текст2025–2026
StepFun · Китай
MoE-модели StepFun, рассчитанные на быструю и дешёвую работу: при 196 млрд параметров Step-3.5/3.7-Flash задействуют около 11 млрд на токен. Step-3.7-Flash понимает картинки.
- Агенты с высокой нагрузкой
- Разбор документов со схемами и скриншотами
- Помощь программистам
- Размеры
- 196B-A11B – 321B
- Железо
- от: Кластер
Текст2024–2026
Cohere · Канада
Модели для бизнеса: поиск по документам со ссылками на источники, вызов инструментов, много языков. Command A+ 2026 года впервые вышла под Apache 2.0.
- Ответы по базе знаний со ссылками на источники
- Агенты, работающие с внутренними системами
- Перевод и переписка на разных языках
- Размеры
- 7B – 218B-A25B
- Железо
- от: 1 видеокарта
Перевод2025–2026
Tencent · Китай
Переводчики Tencent на 33 языка, первая версия победила на соревновании WMT25. Русский есть. Малая версия 1.8B работает на ноутбуке, свежая Hy-MT2 под Apache 2.0.
- Перевод документов с сохранением форматирования
- Перевод с заданным глоссарием терминов
- Перевод переписки с китайскими партнёрами
- Размеры
- 1.8B – 30B-A3B
- Железо
- от: Ноутбук
Модерация и безопасность2024–2026
NVIDIA · США
Фильтры контента NVIDIA для ботов, с отдельными моделями для контроля темы разговора и поиска взлома. Safety Guard v3 обучена на 9 языках, русский проверяли только без дообучения.
- Проверка запросов и ответов бота
- Удержание бота в рамках своей темы
- Поиск попыток обойти правила
- Размеры
- 4B – 8B
- Железо
- от: Ноутбук
Обработка фото2023–2026
BRIA AI · Израиль
Удаление фона от BRIA, обучено на лицензированных фото. Мягкие края, волосы, прозрачность. Есть версии для видео. Для бизнеса нужен платный договор.
- Вырезка товара на белый фон
- Фото сотрудников и экспертов без фона
- Удаление фона на видео
- Размеры
- 44M – 220M
- Железо
- от: Ноутбук
Картинка + текст2023–2026
LLaVA / LMMs-Lab (исследователи из США и Китая) · США / Китай
Открытый проект, с которого пошла мода на модели «картинка + текст». Линейка OneVision понимает фото, документы и видео; открыты данные и рецепты обучения.
- Ответы на вопросы по фото и скриншотам
- Описание товаров по фотографии
- Разбор видео по кадрам
- Размеры
- 0.5B – 72B
- Железо
- от: Ноутбук
Картинка + текст2024–2026
OpenBMB (ModelBest и Университет Цинхуа) · Китай
Компактные модели зрения, которые работают даже на телефоне и ноутбуке. Хорошо читают текст на фото, понимают видео; версия 4.6 весит всего 1.3B.
- Распознавание текста на фото прямо на устройстве
- Разбор чеков и документов без отправки в облако
- Описание фото и видео
- Размеры
- 1.3B – 8B
- Железо
- от: Ноутбук
Картинка + текст2025–2026
Kuaishou · Китай
Модели зрения от Kuaishou с упором на короткие видео. Keye-VL-2.0 (30B, активны 3B) хорошо понимает, что и когда происходит в ролике.
- Разбор и описание коротких видео
- Проверка роликов и контента
- Поиск нужного момента в видео
- Размеры
- 8B – 671B-A37B
- Железо
- от: Ноутбук
Документы и OCR2025–2026
Baidu (PaddlePaddle) · Китай
Компактная модель для разбора документов из популярного набора PaddleOCR. По карточке поддерживает 109 языков, в том числе русский; версия 1.6 лидирует на тесте OmniDocBench.
- Распознавание счетов, договоров и накладных, в том числе на русском
- Распознавание таблиц, формул, печатей
- Перевод сканов в Markdown и JSON
- Размеры
- 0.9B
- Железо
- от: Ноутбук
Документы и OCR2025–2026
Shanghai AI Laboratory (OpenDataLab) · Китай
Популярный открытый инструмент перевода PDF в Markdown со своей небольшой моделью. MinerU2.5-Pro улучшили только за счёт данных, без роста размера. Языки в карточке — китайский и английский.
- Перевод PDF-отчётов и договоров в Markdown
- Распознавание таблиц и формул
- Подготовка документов для RAG и поиска
- Размеры
- 0.9B – 1.2B
- Железо
- от: Ноутбук
Текст2024–2026
Google · США
Компактные модели Google: хорошо работают на одном компьютере, старшие версии понимают картинки.
- Ассистент на ноутбуке без интернета
- Разбор фото документов и чеков
- Классификация обращений
- Размеры
- 270M – 31B
- Железо
- от: Ноутбук
Аватары2024–2026
Фуданьский университет · Китай
Серия говорящих портретов по аудио: от коротких клипов до часовых видео в 4K. Hallo-Live рассчитана на работу в реальном времени.
- Видео с ведущим по фото и аудио
- Длинные обучающие ролики
- Живой аватар
- Размеры
- около 1B – 5B
- Железо
- от: 1 видеокарта
3D2025–2026
Tencent · Китай
Генерация целых 3D-миров и сцен по тексту или картинке, по которым можно ходить. Вторая версия собирает сцену из видео и фото.
- 3D-сцены для игр и виртуальных туров
- Фоны и окружение для видеопродакшна
- Черновики локаций для симуляций
- Размеры
- набор из нескольких моделей
- Железо
- от: 1 видеокарта
Поиск и RAG2024–2026
IBM · США
Лёгкие эмбеддинги IBM для корпоративного поиска, обученные на данных с понятными правами. R2 2026 года стали многоязычными.
- Поиск по корпоративным документам
- RAG на обычном сервере без видеокарты
- Переранжирование результатов
- Размеры
- 30M – 311M
- Железо
- от: Ноутбук
Прогнозы2025–2026
Datadog · США
Модель прогнозов от Datadog, обученная на метриках серверов и приложений. Особенно сильна для IT-мониторинга: нагрузка, задержки, ошибки.
- Прогноз нагрузки на серверы
- Поиск аномалий в метриках
- Планирование мощностей
- Размеры
- 4M – 2.5B
- Железо
- от: Ноутбук
Синтез речи2025–2026
OpenBMB (ModelBest, Университет Цинхуа) · Китай
Синтез речи с клонированием голоса и естественной интонацией. VoxCPM2 поддерживает 30 языков, включая русский.
- Клонирование голоса
- Озвучка роликов и аудиокниг
- Голос для ассистента
- Размеры
- 0.5B – 2.3B
- Железо
- от: Ноутбук
Текст2025–2026
Arcee AI · США
Американское семейство MoE-моделей, обученных с нуля: Nano, Mini и Large. Trinity-Large-Thinking на 398B рассуждает перед ответом.
- Агенты с вызовом инструментов
- Задачи с рассуждением
- Корпоративный ассистент на своих серверах
- Размеры
- 6B – 398B-A13B
- Железо
- от: Ноутбук
Перевод2020–2026
Helsinki-NLP, Хельсинкский университет · Финляндия
Более тысячи маленьких переводчиков, каждый под свою пару языков. Есть русский-английский и обратно. Работают быстро даже на обычном процессоре.
- Массовый перевод коротких текстов
- Перевод прямо на сервере без видеокарты
- Перевод отзывов и заявок перед анализом
- Размеры
- 25M – 240M
- Железо
- от: Ноутбук
Модерация и безопасность2024–2026
IBM · США
Модели-судьи IBM: ловят вред, мат, попытки взлома, а в RAG и агентах проверяют, опирается ли ответ на документы. Можно задать своё правило словами.
- Проверка запросов и ответов бота
- Поиск выдуманных фактов в ответах по базе знаний
- Проверка своих правил, заданных текстом
- Размеры
- 38M – 8B
- Железо
- от: Ноутбук
Модерация и безопасность2026
OpenAI · США
Находит и скрывает персональные данные: имена, адреса, телефоны, почту, номера счетов, пароли. Работает даже в браузере. Обучена в основном на английском.
- Очистка текста от персональных данных перед отправкой в облачный ИИ
- Поиск паролей и ключей в текстах
- Обезличивание переписки для аналитики
- Размеры
- 1.5B (50M активных)
- Железо
- от: Ноутбук
Картинка + текст2025–2026
IBM · США
Компактные модели IBM для корпоративных документов: таблицы, графики, формы, пары «поле — значение». Карточка честно предупреждает, что лучше всего работает с английским.
- Извлечение полей из форм и счетов
- Перевод графиков и таблиц в данные
- Ответы на вопросы по документам
- Размеры
- 2B – 4B
- Железо
- от: Ноутбук
Текст2023–2026
Mistral AI · Франция
Европейские модели с упором на скорость. Mixtral — одна из первых открытых моделей на архитектуре «смесь экспертов».
- Быстрые ответы в чате
- Извлечение данных из текста
- Перевод и работа с несколькими языками
- Размеры
- 3B – 675B
- Железо
- от: Ноутбук
Компьютерное зрение2023–2026
Meta · США
Выделяет любой объект на фото и видео по клику или рамке. Основа для удаления фона и подсчёта объектов.
- Удаление фона с фото товара
- Подсчёт объектов на фото
- Разметка данных для обучения
- Размеры
- 91M – ~0,85B
- Железо
- от: Ноутбук
Медицина2025–2026
Чжэцзянский университет · Китай
Медицинская модель для текста, снимков, 3D-исследований и видео: от лёгкой 4B до крупной MoE. Не заменяет врача, решения принимает специалист.
- Подсказки при разборе снимков и КТ для врача
- Черновики заключений и выписок
- Поиск по медицинской литературе
- Размеры
- 4B – 235B-A22B
- Железо
- от: Ноутбук
Математика и рассуждения2025–2026
Принстонский университет · США
Открытые модели для формальных доказательств в Lean 4 из Принстона. Свежая Goedel-Code-Prover доказывает корректность программ.
- Формальная проверка математических выкладок
- Проверка корректности кода
- Обучение
- Размеры
- 7B – 32B
- Железо
- от: Ноутбук
Поиск и RAG2026
Perplexity · США
Эмбеддинги поискового сервиса Perplexity. Есть версии, которые учитывают контекст всего документа, а не только отдельного фрагмента.
- Поиск по большим массивам документов
- RAG с учётом контекста документа
- Поиск по сайту и каталогу
- Размеры
- 0.6B – 4B
- Железо
- от: Ноутбук
Роботы2025–2026
NVIDIA · США
Базовая модель NVIDIA для человекоподобных роботов и манипуляторов: видит, понимает команду и выдаёт движения. Встроена в экосистему Isaac.
- Управление человекоподобными роботами
- Дообучение под свою роботизированную ячейку
- Обучение в симуляции с переносом на реального робота
- Размеры
- 2B – 3B
- Железо
- от: 1 видеокарта
Речь в текст2025–2026
Mistral AI · Франция
Речевые модели Mistral: понимают аудио, расшифровывают и отвечают на вопросы по записи. Realtime-версия распознаёт в реальном времени и поддерживает русский; есть синтез речи.
- Расшифровка и краткое содержание записей
- Вопросы к аудио
- Распознавание в реальном времени
- Размеры
- 3B – 24B
- Железо
- от: Ноутбук
Синтез речи2024–2026
Fish Audio · США / Китай
Синтез речи с клонированием голоса и управлением эмоциями на 80+ языках, включая русский. Качество близко к платным сервисам, но веса только для исследований.
- Клонирование голоса
- Эмоциональная озвучка
- Озвучка на многих языках
- Размеры
- 0.5B – около 4.5B
- Железо
- от: Ноутбук
Текст2024–2026
Sarvam AI · Индия
Индийские модели с упором на 22 языка Индии. Sarvam 30B и 105B 2026 года это MoE-модели с сильными навыками рассуждения и работы в агентах.
- Многоязычная поддержка клиентов
- Задачи с рассуждением и расчётами
- Агенты с вызовом инструментов
- Размеры
- 2B – 105B-A10B
- Железо
- от: Ноутбук
Текст2025–2026
Reka AI · США
Компактные модели Reka: Flash 3 на 21B для рассуждений и Reka Edge на 7B, которая быстро разбирает изображения и видео на устройстве.
- Разбор фото и видео (Edge)
- Поиск объектов на изображениях
- Задачи с рассуждением (Flash)
- Размеры
- 7B – 21B
- Железо
- от: Ноутбук
Картинка + текст2023–2026
Shanghai AI Laboratory (OpenGVLab) · Китай
Большая линейка китайских моделей зрения с размерами от 1B до 241B. InternVL-U (4B) объединяет понимание картинок, их генерацию и редактирование.
- Понимание документов, схем и графиков
- Ответы на вопросы по фото
- Разбор видео
- Размеры
- 1B – 241B-A28B
- Железо
- от: Ноутбук
Картинка + текст2024–2026
Ai2 (Allen Institute for AI) · США
Полностью открытые модели зрения Ai2 (веса и данные). Умеют указывать точку на картинке и считать предметы; Molmo2 понимает видео, MolmoWeb управляет браузером.
- Подсчёт товаров и объектов на фото
- Указание, где на снимке нужный предмет
- Разбор видео
- Размеры
- 1B-A7B – 72B
- Железо
- от: Ноутбук
Документы и OCR2025–2026
rednote hilab (Xiaohongshu) · Китай
Многоязычная модель для разбора документов: текст, таблицы, формулы и порядок чтения за один проход. dots.mocr ещё переводит графики и схемы в векторный SVG.
- Распознавание счетов, договоров и накладных
- Перевод таблиц в редактируемый вид
- Перевод графиков и схем в векторный формат
- Размеры
- около 3B
- Железо
- от: Ноутбук
Документы и OCR2025–2026
Datalab · США
Сильная OCR-модель от авторов Marker и Surya: рукописный текст, формы, таблицы. По карточке поддерживает 90+ языков, русский есть среди примеров.
- Распознавание счетов, договоров и накладных, в том числе на русском
- Распознавание рукописных форм и анкет
- Распознавание сложных таблиц
- Размеры
- 5B – 9B
- Железо
- от: Ноутбук
Документы и OCR2026
Baidu (Qianfan) · Китай
Модель Baidu, которая не только распознаёт документ, но и отвечает на вопросы по нему. По карточке поддерживает 192 языка, включая кириллицу.
- Распознавание счетов, договоров и накладных, в том числе на русском
- Разметка страницы и распознавание таблиц
- Ответы на вопросы по документу
- Размеры
- 4B
- Железо
- от: Ноутбук
Код2024–2026
Alibaba (команда Qwen) · Китай
Самая широкая открытая линейка для кода: от 0.5B для автодополнения до 480B для агентов. Qwen3-Coder-Next (80B, активны 3B) работает как агент-разработчик на одной видеокарте.
- Автодополнение кода в редакторе
- Агент, который сам правит код в репозитории
- Генерация и доработка скриптов, SQL, интеграций
- Размеры
- 0.5B – 480B-A35B
- Железо
- от: Ноутбук
Код2026
IQuest Research · Китай
Семейство моделей для кода с обычными и рассуждающими версиями, в том числе вариант Loop с повторным проходом по слоям. Размеры от 7B до 40B.
- Генерация и доработка кода
- Решение задач с пошаговыми рассуждениями
- Агентная работа с репозиторием
- Размеры
- 7B – 40B
- Железо
- от: Ноутбук
Код2026
Ai2 (Allen Institute for AI) · США
Полностью открытые агенты-разработчики от Ai2: открыты веса, данные и рецепт обучения. Задуманы так, чтобы компания могла дешево доучить агента на своём репозитории.
- Агент для исправления задач в коде
- Дообучение агента под внутренний репозиторий
- Автоматизация мелких правок и тестов
- Размеры
- 8B – 32B
- Железо
- от: Ноутбук
Картинки2025–2026
Meituan · Китай
Модель генерации и редактирования картинок на 6B от Meituan. Хорошо пишет китайский текст, есть быстрая версия для правок.
- Генерация картинок по описанию
- Правка фото по инструкции
- Визуалы для карточек товаров
- Размеры
- 6B
- Железо
- от: 1 видеокарта
Математика и рассуждения2026
LM Provers (CMU, Hugging Face, ETH Zurich, Project Numina) · США, Швейцария, Франция
Маленькая модель 4B на Qwen3, которая пишет математические доказательства на обычном языке почти на уровне больших моделей. Запускается на ноутбуке.
- Проверка логики рассуждений и выкладок
- Пошаговое объяснение решений
- Обучение и олимпиадная подготовка
- Размеры
- 4B
- Железо
- от: Ноутбук
Голосовые ассистенты2024–2026
Kyutai · Франция
Голосовой ассистент, который слушает и говорит одновременно, без задержки на распознавание и синтез. Hibiki — синхронный перевод речи в речь между несколькими европейскими языками.
- Голосовой собеседник в реальном времени
- Синхронный перевод речи
- Голосовые интерфейсы без задержки
- Размеры
- 2B – 7B
- Железо
- от: Ноутбук
Голосовые ассистенты2025–2026
OpenBMB (ModelBest, Университет Цинхуа) · Китай
Небольшая модель, которая видит, слышит и отвечает голосом в реальном времени, может клонировать голос. Голосовой диалог на английском и китайском, текст — на 30+ языках.
- Голосовой ассистент на своём сервере
- Разбор видео и документов
- Ответы голосом по картинке с камеры
- Размеры
- 8B – 9B
- Железо
- от: Ноутбук
Примерка одежды2026
FASHN AI · Израиль
Редкая открытая примерка с коммерческой лицензией: без маски, берёт фото вещи на модели или раскладку. Веса около 2 ГБ.
- Карточки товара на модели без фотосессии
- Примерочная на сайте магазина
- Каталог из фото раскладки одежды
- Размеры
- 972M
- Железо
- от: 1 видеокарта
Картинки2024–2026
Black Forest Labs · Германия
Генерация картинок от авторов Stable Diffusion. Хорошо рисует текст на изображении и держит композицию.
- Картинки для карточек товаров
- Баннеры и обложки
- Редактирование фото по описанию (Kontext)
- Размеры
- 4B – 32B
- Железо
- от: 1 видеокарта
Картинки2024–2026
Tencent · Китай
Модели картинок Tencent. HunyuanImage 3.0 — крупнейшая открытая MoE-модель генерации на 80B, умеет рассуждать над запросом и редактировать по инструкции.
- Сложные сцены по длинному описанию
- Картинки с текстом на китайском и английском
- Редактирование изображений по инструкции
- Размеры
- 1.5B – 80B-A13B
- Железо
- от: 1 видеокарта
Картинки2025–2026
Alibaba (Tongyi-MAI) · Китай
Компактная модель на 6B с фотореализмом уровня крупных моделей. Turbo-версия выдаёт картинку за несколько шагов на обычной игровой видеокарте.
- Фотореалистичные рекламные картинки
- Картинки с текстом на русском, английском и китайском
- Массовая генерация визуалов
- Размеры
- 6B
- Железо
- от: 1 видеокарта
Картинки2026
Zhipu AI (Z.ai) · Китай
Гибрид языковой модели на 9B и декодера на 7B. Сильна в картинках с большим количеством текста: постеры, инфографика, слайды.
- Постеры и баннеры с текстом
- Инфографика
- Иллюстрации к презентациям
- Размеры
- 9B + 7B
- Железо
- от: 1 видеокарта
Видео2025–2026
Skywork AI (Kunlun Tech) · Китай
Видеомодели для кинематографичных сцен с людьми. Умеют ролики неограниченной длины, продление видео и говорящих персонажей по аудио.
- Длинные ролики с продолжением
- Видео с одним персонажем по референсу
- Говорящий аватар по голосу
- Размеры
- 1.3B – 19B
- Железо
- от: 1 видеокарта
Аватары2024–2026
Ant Group · Китай
Говорящие аватары от Ant Group: лицо, а с V2 и жесты рук. V3-Flash выдаёт видео за 8 шагов и укладывается в 12 ГБ видеопамяти.
- Видео с ведущим по фото и голосу
- Аватар с жестами для презентаций
- Озвученные персонажи
- Размеры
- до 1.3B
- Железо
- от: 1 видеокарта
Аватары2025–2026
Alibaba (Quark) · Китай
Потоковый аватар в реальном времени неограниченной длины. Подходит для живых эфиров и диалога, но требует мощного серверного железа.
- Живой аватар для диалога с клиентом
- Бесконечные трансляции с ведущим
- Интерактивные персонажи
- Размеры
- 14B
- Железо
- от: 1 видеокарта
Медицина2025–2026
Google · США
Медицинская версия Gemma от Google: читает медицинские тексты и снимки (рентген, дерматология, гистология). Инструмент для врача и разработчика, не заменяет врача, решения принимает специалист.
- Черновики выписок и заключений для проверки врачом
- Подсказки при разборе снимков для врача
- Поиск и пересказ медицинской литературы
- Размеры
- 4B – 27B
- Железо
- от: Ноутбук
Медицина2023–2026
Stanford AIMI · США
Стэнфордские модели для рентгена грудной клетки: описывают снимок и готовят черновик заключения. Не заменяет врача, решения принимает специалист.
- Черновик описания рентгенограммы для врача-рентгенолога
- Подсказки при разборе снимков для врача
- Проверка полноты заключений
- Размеры
- 3B – 8B
- Железо
- от: Ноутбук
Медицина2025–2026
Alibaba DAMO Academy · Китай
Медицинская модель Alibaba на основе Qwen2.5-VL: понимает снимки разных типов и медицинский текст, умеет рассуждать по шагам. Не заменяет врача, решения принимает специалист.
- Подсказки при разборе снимков для врача
- Черновики заключений и выписок
- Поиск по медицинской литературе
- Размеры
- 7B – 32B
- Железо
- от: Ноутбук
Медицина2025–2026
Ant Healthcare (Ant Group) и Центр медицинской информации провинции Чжэцзян · Китай
Крупная медицинская MoE-модель на базе Ling-flash-2.0: 100B параметров, из них в работе 6B, поэтому отвечает быстро. Не заменяет врача, решения принимает специалист.
- Справочные ответы персоналу по клиническим вопросам
- Черновики выписок для проверки врачом
- Поиск по медицинской литературе
- Размеры
- 100B-A6B
- Железо
- от: 1 видеокарта
Компьютерное зрение2023–2026
Ultralytics · США
Самый распространённый детектор объектов в реальном времени: находит и выделяет предметы на видео даже на слабом железе. YOLOv5 вышел ещё в 2020, в каталоге отсчёт от YOLOv8.
- Подсчёт людей, машин, товаров на видео
- Контроль касок и спецодежды
- Поиск брака на конвейере
- Размеры
- 2.4M – 68M
- Железо
- от: Ноутбук
Поиск и RAG2025–2026
Alibaba (Qwen) · Китай
Эмбеддинги и реранкеры на базе Qwen3, в числе лучших открытых для многоязычного поиска, включая русский. VL-версии ищут по картинкам, скриншотам и видео.
- Поиск по базе знаний для RAG
- Переранжирование найденного перед ответом
- Поиск по сканам, слайдам и скриншотам
- Размеры
- 0.6B – 8B
- Железо
- от: Ноутбук
Поиск и RAG2026
Voyage AI (MongoDB) · США
Единственная открытая модель линейки Voyage 4: её векторы совместимы с платными старшими версиями, можно начать локально и позже перейти на API.
- Поиск по документам на своём сервере
- RAG для небольших баз знаний
- Поиск похожих текстов
- Размеры
- около 340M
- Железо
- от: Ноутбук
Синтез речи2026
Alibaba (Qwen) · Китай
Синтез речи на 10 языках, включая русский: клонирование голоса по 3 секундам, готовые голоса и создание голоса по текстовому описанию.
- Голос для бота и ассистента
- Клонирование фирменного голоса
- Подбор голоса по описанию
- Размеры
- 0.6B – 1.7B
- Железо
- от: Ноутбук
Текст2023–2026
Baichuan Intelligence · Китай
Сначала универсальные китайские модели, с 2025 года — медицинская линия. Baichuan-M3 (на основе Qwen3-235B) обучена моделировать ход клинического рассуждения врача.
- Справочный помощник врача
- Предварительный опрос пациента
- Разбор медицинских документов
- Размеры
- 7B – 235B-A22B
- Железо
- от: Ноутбук
Текст2023–2026
Technology Innovation Institute (TII) · ОАЭ
Семейство из Абу-Даби: от ранних Falcon 40B и 180B до гибридных Falcon-H1 и сверхмалых Falcon-H1-Tiny на 90–600M параметров для устройств.
- Ассистент и ответы по документам
- Работа на слабом железе и в устройствах
- Вызов инструментов в простых агентах
- Размеры
- 90M – 180B
- Железо
- от: Ноутбук
Текст2023–2026
Microsoft · США
Малые модели Microsoft, обученные на тщательно отобранных данных: сильны в логике и математике при скромном размере. Есть версии с картинками и речью.
- Ассистент на ноутбуке или своём сервере
- Задачи с рассуждением и расчётами
- Разбор изображений и схем (vision-версии)
- Размеры
- 1.3B – 42B-A6.6B
- Железо
- от: Ноутбук
Текст2024–2026
Allen Institute for AI (Ai2) · США
Полностью открытые модели: опубликованы не только веса, но и данные, код обучения и промежуточные снимки. Удобно, когда важна прозрачность происхождения.
- Ассистент и ответы по документам
- Задачи с рассуждением (версии Think)
- Дообучение под свои данные с понятной историей модели
- Размеры
- 1B – 32B
- Железо
- от: Ноутбук
Текст2024–2026
AI21 Labs · Израиль
Гибрид трансформера и Mamba с окном до 256K токенов: держит длинные документы быстрее обычных моделей. Jamba2 ориентирована на точные ответы по источникам.
- Ответы по длинным регламентам и договорам
- Поиск по базе знаний (RAG)
- Пересказ больших документов
- Размеры
- 3B – 398B-A94B
- Железо
- от: Ноутбук
Текст2024–2026
Prime Intellect · США
Модели, обученные распределённо на видеокартах со всего мира. INTELLECT-3 на 106B дообучена с подкреплением для математики, кода и агентов.
- Задачи с рассуждением и математикой
- Помощь в программировании
- Агенты с вызовом инструментов
- Размеры
- 10B – 106B-A12B
- Железо
- от: 1 видеокарта
Текст2024–2026
Консорциум UTTER (Unbabel, университеты Лиссабона, Эдинбурга, Амстердама и др.) · Евросоюз
Европейские языковые модели, обученные на всех языках ЕС и ряде других, с упором на перевод. Русский есть. Свободная лицензия.
- Перевод и локализация текстов
- Ответы на вопросы на разных языках
- Черновики писем для зарубежных партнёров
- Размеры
- 1.7B – 22B
- Железо
- от: Ноутбук
Перевод2026
Google · США
Переводчики на базе Gemma 3 на 55 языков, умеют переводить и текст на картинках. Русский есть. Версия 4B помещается на ноутбук.
- Перевод документов и переписки
- Перевод текста со скриншотов и фото
- Локализация сайтов и приложений
- Размеры
- 4B – 27B
- Железо
- от: Ноутбук
Документы и OCR2025–2026
DeepSeek · Китай
OCR-модель, которая сильно сжимает страницу в небольшое число визуальных токенов, поэтому быстро обрабатывает большие объёмы. Версия 2 лучше понимает порядок чтения.
- Массовое распознавание сканов счетов и договоров
- Распознавание таблиц
- Перевод PDF в Markdown для поиска и RAG
- Размеры
- около 3B
- Железо
- от: Ноутбук
Документы и OCR2026
Zhipu AI (Z.ai) · Китай
Лёгкая OCR-модель Zhipu для разбора документов. В карточке русский указан среди поддерживаемых языков; рассчитана на высокую нагрузку и слабое железо.
- Распознавание счетов, договоров и накладных, в том числе на русском
- Распознавание таблиц и формул
- Извлечение полей в JSON
- Размеры
- 0.9B
- Железо
- от: Ноутбук
Документы и OCR2025–2026
LightOn · Франция
Французская OCR-модель на 1B, которая переводит страницу в текст за один проход и быстро работает на потоке. Языки в карточке — европейские, китайский и японский, русского нет.
- Распознавание счетов и договоров на европейских языках
- Распознавание таблиц
- Перевод PDF в текст для поиска и RAG
- Размеры
- 0.9B – 1B
- Железо
- от: Ноутбук
Код2025
Mistral AI (с All Hands AI) · Франция
Модели Mistral для агентной разработки: сами читают репозиторий, правят файлы и запускают команды. Версия 24B помещается на одну видеокарту.
- Агент-разработчик для исправления задач из трекера
- Доработка внутренних систем по описанию
- Автоматизация рутинных правок в коде
- Размеры
- 24B – 123B
- Железо
- от: 1 видеокарта
3D2024–2025
Microsoft · США
Одна из сильнейших открытых 3D-моделей: по картинке или тексту выдаёт сетку с текстурой или гауссову сцену. TRELLIS.2 заметно детальнее первой версии.
- 3D-модели товаров и интерьера по фото
- Ассеты для игр и AR/VR
- Прототипы для 3D-печати
- Размеры
- до 4B (TRELLIS.2)
- Железо
- от: 1 видеокарта
Компьютерное зрение2024–2025
ByteDance и Гонконгский университет · Китай
Определяет глубину — расстояние до каждой точки — по одной обычной фотографии или видео. DA3 восстанавливает геометрию сцены с нескольких кадров.
- Оценка расстояний и объёмов по камере
- Эффекты глубины для фото и видео
- Навигация роботов и дронов
- Размеры
- 25M – 1.4B
- Железо
- от: Ноутбук
Речь в текст2025
Meta · США
Распознавание речи на 1600+ языках, включая русский и редкие языки, которые раньше не поддерживала ни одна система. Новый язык можно добавить по нескольким примерам.
- Расшифровка на редких и местных языках
- Оцифровка устных архивов
- Субтитры на многих языках
- Размеры
- 300M – 7B
- Железо
- от: Ноутбук
Речь в текст2024–2025
Alibaba (Tongyi, FunAudioLLM) · Китай
Набор моделей Alibaba для быстрого распознавания речи, в первую очередь китайской и азиатских языков. SenseVoice дополнительно определяет эмоции и звуковые события.
- Расшифровка звонков
- Определение эмоций в голосе
- Распознавание смеха, музыки и других звуков
- Размеры
- около 230M – 800M
- Железо
- от: Ноутбук
Синтез речи2024–2025
Alibaba (Tongyi, FunAudioLLM) · Китай
Синтез речи с клонированием голоса по короткому образцу и потоковой выдачей для живого диалога. Третья версия поддерживает 9 языков, включая русский.
- Голос для бота и ассистента
- Клонирование фирменного голоса
- Озвучка роликов
- Размеры
- 300M – 0.5B
- Железо
- от: Ноутбук
Текст2025
Naver · Южная Корея
Открытые младшие модели корейского Naver: от 0.5B до 32B, включая рассуждающие Think и мультимодальные версии с пониманием картинок.
- Лёгкий корейско-английский ассистент
- Разбор картинок и документов
- Классификация текстов
- Размеры
- 0.5B – 32B
- Железо
- от: Ноутбук
Текст2024–2025
Т-Банк · Россия
Модели Т-Банка, дообученные на основе Qwen специально для русского языка: заметно лучше исходной модели пишут и рассуждают по-русски. T-Lite — 8B, T-Pro — 32B на одну видеокарту.
- Русскоязычный чат-бот поддержки
- Разбор обращений и документов на русском
- Ответы по базе знаний компании
- Размеры
- 7B – 32B
- Железо
- от: Ноутбук
Картинка + текст2023–2025
Zhipu AI (Z.ai) и Университет Цинхуа · Китай
Модели зрения от Zhipu: сначала CogVLM, затем линейка GLM-V. GLM-4.6V умеет вызывать инструменты по картинкам и работать как агент с интерфейсом.
- Ответы на вопросы по фото и документам
- Агент, работающий с интерфейсом по скриншотам
- Разбор графиков и отчётов
- Размеры
- 9B – 106B-A12B
- Железо
- от: Ноутбук
Видео2024–2025
Tencent · Китай
Видеомодель Tencent, одна из первых открытых на уровне закрытых сервисов. Версия 1.5 стала легче (8.3B) и идёт на потребительских картах.
- Видео по текстовому сценарию
- Оживление изображений
- База для дообучения своих видеомоделей
- Размеры
- 8.3B – 13B
- Железо
- от: 1 видеокарта
Математика и рассуждения2024–2025
DeepSeek · Китай
Математические модели DeepSeek. Первая версия 7B ввела метод обучения GRPO, V2 на 685B пишет и сама проверяет доказательства уровня олимпиад.
- Расчёты и проверка формул
- Проверка математических выкладок в отчётах
- Разбор задач по шагам
- Размеры
- 7B – 685B
- Железо
- от: Ноутбук
3D2025
Meta · США
Восстанавливает 3D-форму предмета или тела человека по одной обычной фотографии, даже если объект частично закрыт. Две модели: Objects и Body.
- 3D-модель предмета с фото из каталога
- Оценка позы и формы тела по фото
- Примерка и AR-сценарии
- Размеры
- н/д
- Железо
- от: 1 видеокарта
Текст2023–2025
Nous Research · США
Дообучения Nous Research поверх Llama, Mistral, Qwen и Seed-OSS. Ценятся за точное следование инструкциям, вызов функций и ответы в строгом JSON; реже отказывают, чем исходные модели, у Hermes 4 есть режим рассуждений.
- Агенты, вызывающие функции и API
- Извлечение данных в строгом формате JSON
- Ассистент с гибкой настройкой роли и тона
- Размеры
- 3B – 405B
- Железо
- от: Ноутбук
Синтез речи2022–2025
Silero · Россия
Лёгкий синтез русской речи, работает на обычном процессоре. Версия v5 добавила языки СНГ и народов России: татарский, башкирский, якутский, казахский и другие.
- Озвучка ответов голосового бота
- Чтение текстов на русском
- Голоса на языках народов России
- Размеры
- десятки мегабайт
- Железо
- от: Ноутбук
Синтез речи2025
Nari Labs · Южная Корея
Модель, которая озвучивает целые диалоги на два голоса со смехом, вздохами и паузами. Только английский.
- Озвучка диалогов и подкастов
- Рекламные ролики с живой речью
- Сценки для обучения
- Размеры
- 1B – 2B
- Железо
- от: Ноутбук
Видео2025
Meituan · Китай
Видеомодель на 13.6B: из текста, из картинки и продолжение видео. Держит качество на роликах в несколько минут.
- Длинные ролики
- Видео из фото
- Продолжение готового видео
- Размеры
- 13.6B
- Железо
- от: 1 видеокарта
Компьютерное зрение2023–2025
IDEA Research · Китай
Находит на картинке любые объекты по текстовому описанию, без обучения на своих данных: «красная коробка», «человек без каски». Rex-Omni — новое поколение на базе VLM.
- Поиск объектов по описанию без разметки
- Автоматическая разметка данных для обучения
- Проверка фото на соответствие требованиям
- Размеры
- 172M – 3B
- Железо
- от: Ноутбук
Прогнозы2024–2025
Amazon · США
Модели прогнозов Amazon, одни из самых скачиваемых. Chronos-2 учитывает внешние факторы: цены, акции, погоду.
- Прогноз спроса с учётом акций и цен
- Планирование запасов
- Прогноз выручки и потоков клиентов
- Размеры
- 8M – 710M
- Железо
- от: Ноутбук
Музыка и звук2025
ASLP-lab (Северо-Западный политехнический университет) · Китай
Быстрая генерация полной песни с вокалом по тексту и образцу стиля, до нескольких минут звучания.
- Песни и джинглы по тексту
- Музыка для роликов
- Демо-версии композиций
- Размеры
- около 1.1B
- Железо
- от: Ноутбук
Модерация и безопасность2025
OpenAI · США
Модерация по вашим правилам: политику пишете обычным текстом, модель рассуждает и выносит решение с объяснением. Построена на gpt-oss.
- Модерация по внутренним правилам компании
- Разметка спорных сообщений с объяснением
- Проверка отзывов и объявлений перед публикацией
- Размеры
- 20B – 120B
- Железо
- от: 1 видеокарта
Картинка + текст2023–2025
Alibaba (команда Qwen) · Китай
Одна из сильнейших открытых моделей зрения: читает документы, таблицы, графики, видео, работает с интерфейсами. С Qwen3.5 зрение встроено прямо в основную модель Qwen.
- Извлечение данных из сканов счетов и накладных
- Разбор фотографий товаров и витрин
- Анализ видео и записей с камер
- Размеры
- 2B – 235B-A22B
- Железо
- от: Ноутбук
Документы и OCR2025
Ai2 (Allen Institute for AI) · США
Модель и набор инструментов для массового перевода PDF в чистый текст с сохранением порядка чтения, таблиц и формул. Рассчитана на обработку миллионов страниц.
- Массовая оцифровка архива PDF
- Распознавание договоров и отчётов в текст
- Подготовка документов для поиска и RAG
- Размеры
- 7B
- Железо
- от: 1 видеокарта
Документы и OCR2025
Nanonets · США / Индия
Модель для перевода документов в Markdown с таблицами, печатями, подписями, галочками и водяными знаками. В карточке OCR2 русский указан среди языков.
- Распознавание счетов, договоров и накладных, в том числе на русском
- Распознавание печатей, подписей и отметок
- Распознавание рукописного текста
- Размеры
- 1.5B – 3B
- Железо
- от: Ноутбук
3D2024–2025
Tencent · Китай
Открытая 3D-линейка Tencent: форма и текстура по картинке, качество на уровне платных сервисов. Omni добавляет управление позой и формой, Part делит модель на детали.
- 3D-модели товаров с текстурой
- Персонажи и предметы для игр
- Разделение модели на детали для печати
- Размеры
- набор моделей: форма и текстуры
- Железо
- от: 1 видеокарта
Поиск и RAG2025
Google · США
Маленькая многоязычная модель эмбеддингов на базе Gemma 3, работает даже на телефоне и ноутбуке без интернета.
- Поиск по документам на устройстве
- RAG без отправки данных наружу
- Классификация текстов
- Размеры
- 300M
- Железо
- от: Ноутбук
Роботы2025
Physical Intelligence · США
Модели управления роботами от Physical Intelligence: складывание белья, уборка, работа с предметами. π0.5 лучше справляется в незнакомой обстановке.
- Управление манипуляторами и двуруким роботом
- Дообучение под свои операции
- Пилоты по автоматизации ручного труда
- Размеры
- около 3B
- Железо
- от: 1 видеокарта
Речь в текст2023–2025
Alpha Cephei · Россия
Офлайн-распознавание русской речи, которое работает даже на Raspberry Pi и телефоне, без интернета. Есть потоковые модели для живого звука и простой русский синтез речи Vosk TTS.
- Расшифровка звонков и записей на русском без облака
- Голосовое управление в приложениях и киосках
- Распознавание речи в потоке с малой задержкой
- Размеры
- около 45 МБ – 1,8 ГБ
- Железо
- от: Ноутбук
Голосовые ассистенты2025
Alibaba (Qwen) · Китай
Модели, которые понимают текст, картинки, аудио и видео и отвечают голосом в реальном времени. Qwen3-Omni говорит на 10 языках, включая русский.
- Голосовой ассистент для клиентов
- Разбор звонков и видео
- Ответы голосом по документам и картинкам
- Размеры
- 3B – 30B-A3B
- Железо
- от: Ноутбук
Текст2025
Baidu · Китай
Первая открытая линия Baidu: от крошечной 0.3B до MoE на 300 млрд параметров, есть версии с пониманием картинок. Средняя 21B-A3B помещается на одну видеокарту.
- Корпоративный ассистент
- Разбор документов и изображений
- Классификация обращений
- Размеры
- 0.3B – 300B-A47B
- Железо
- от: Ноутбук
Текст2024–2025
Vikhr Models · Россия
Русскоязычные дообучения открытых моделей (Mistral, Qwen, Llama) от независимой команды Vikhr: улучшают русский язык, есть компактные версии для обычного ПК.
- Русскоязычный ассистент на своём ПК или сервере
- Ответы по базе знаний (RAG)
- Тексты и письма на русском
- Размеры
- 0.5B – 24B
- Железо
- от: Ноутбук
Модерация и безопасность2025
Alibaba (Qwen) · Китай
Фильтры безопасности на 119 языков, русский в их числе. Версия Stream проверяет ответ бота прямо во время его генерации и может оборвать его на лету.
- Фильтр запросов к боту на русском
- Остановка опасного ответа во время генерации
- Разметка сообщений по категориям риска
- Размеры
- 0.6B – 8B
- Железо
- от: Ноутбук
Документы и OCR2025
IBM и Hugging Face · США
Крошечные модели для открытого конвертера документов Docling: переводят страницу в разметку с таблицами, формулами и кодом. Работают на обычном ноутбуке.
- Перевод PDF и сканов в Markdown для поиска и RAG
- Распознавание таблиц из отчётов
- Разбор счетов и договоров на обычном ПК
- Размеры
- 256M – 258M
- Железо
- от: Ноутбук
Текст2025
OpenAI · США
Первые открытые модели OpenAI со времён GPT-2. Рассуждения, вызов инструментов, младшая версия помещается на одну видеокарту.
- ИИ-агент с вызовом внутренних систем
- Ответы по регламентам
- Черновики писем и отчётов
- Размеры
- 20B, 120B
- Железо
- от: 1 видеокарта
Аватары2025
Meituan · Китай
Дубляж и говорящие персонажи на базе Wan: MultiTalk ведёт диалог нескольких людей, InfiniteTalk переозвучивает видео любой длины с мимикой и телом.
- Дубляж видео с подгонкой мимики
- Диалог двух персонажей по аудио
- Длинные ролики с ведущим
- Размеры
- 14B
- Железо
- от: 1 видеокарта
Математика и рассуждения2025
Moonshot AI и Project Numina · Китай, Франция
Модели для формальных доказательств в Lean 4 от Moonshot AI (Kimi) и Numina. Есть маленькие версии от 0.6B, которые запускаются на ноутбуке.
- Формальная проверка математических выкладок
- Перевод задачи с обычного языка на Lean
- Обучение и олимпиадная подготовка
- Размеры
- 0.6B – 72B
- Железо
- от: Ноутбук
Компьютерное зрение2023–2025
Meta · США
Базовые модели, которые превращают картинку в числовой «отпечаток». На них строят поиск похожих изображений, классификацию и сегментацию без большой разметки.
- Поиск похожих товаров и фото
- Классификация изображений на малых данных
- Основа для своих моделей контроля качества
- Размеры
- 21M – 7B
- Железо
- от: Ноутбук
Прогнозы2024–2025
Salesforce · США
Универсальная модель прогнозов Salesforce для рядов с разной частотой и многими переменными. Веса открыты только для исследований.
- Исследовательские пилоты прогнозов
- Сравнение с другими моделями прогнозов
- Прогнозы по многим связанным рядам
- Размеры
- 11M – 311M
- Железо
- от: Ноутбук
Текст2024–2025
НИВЦ МГУ, лаборатория LAIR (RefalMachine) · Россия
Модели Qwen, переделанные под русский язык: заменён токенизатор и проведено дообучение на русских текстах. За счёт этого русский текст генерируется до двух раз быстрее, чем у исходной модели того же размера.
- Русскоязычный ассистент на своём сервере
- Ответы по документам компании (RAG) на русском
- Разбор и пересказ длинных русских текстов
- Размеры
- 1.5B – 32B
- Железо
- от: Ноутбук
Текст2025
ByteDance · Китай
Открытая модель ByteDance на 36B с контекстом до 512 тыс. токенов и настраиваемым «бюджетом размышлений». Помещается на одну мощную видеокарту.
- Разбор длинных документов
- Агенты с инструментами
- Корпоративный ассистент
- Размеры
- 36B
- Железо
- от: 1 видеокарта
Текст2024–2025
xAI · США
xAI выкладывает веса прошлых поколений Grok. Модели очень большие и требуют кластера видеокарт, поэтому на практике их запускают редко.
- Исследования больших моделей
- Ассистент на собственной инфраструктуре
- Генерация и анализ текстов
- Размеры
- 314B (Grok-1), Grok-2 крупнее
- Железо
- от: Кластер
Примерка одежды2025
Kunbyte AI · Китай
Примерка не только одежды: очки, серьги, сумки, шляпы, часы и другие аксессуары. Работает без маски. Требует видеокарту от 28 ГБ.
- Примерка аксессуаров и украшений на фото
- Карточки товара с аксессуаром на модели
- Примерочная очков и бижутерии на сайте
- Размеры
- дополнение к FLUX.1 Fill dev 12B
- Железо
- от: 1 видеокарта
Медицина2025
Google · США
Лёгкий кодировщик медицинских снимков и текста от Google, тот же, что внутри MedGemma. Сортирует и ищет похожие снимки. Не заменяет врача, решения принимает специалист.
- Поиск похожих снимков в архиве клиники
- Предварительная сортировка снимков для врача
- Основа для своих классификаторов снимков
- Размеры
- около 0.9B
- Железо
- от: Ноутбук
Медицина2025
Intelligent Internet · Великобритания
Рассуждающие медицинские модели на Qwen3, которые рассчитаны на запуск на обычном компьютере. Не заменяет врача, решения принимает специалист.
- Справочные ответы персоналу с ходом рассуждения
- Черновики выписок для проверки врачом
- Поиск по медицинской литературе
- Размеры
- 7B – 32B
- Железо
- от: Ноутбук
Речь в текст2025
Т-Банк · Россия
Компактная потоковая модель Т-Банка для распознавания русской речи в телефонных разговорах. Работает в реальном времени даже без видеокарты.
- Расшифровка телефонных звонков
- Голосовые роботы на линии
- Контроль качества разговоров
- Размеры
- 72M
- Железо
- от: Ноутбук
Текст2024–2025
Hugging Face · США
Крошечные открытые модели Hugging Face для телефонов и ноутбуков. SmolLM3 на 3B умеет рассуждать и держит длинный контекст, весь рецепт обучения открыт.
- Простой ассистент прямо на устройстве
- Классификация и маршрутизация обращений
- Основа для дообучения под узкую задачу
- Размеры
- 135M – 3B
- Железо
- от: Ноутбук
Перевод2025
ByteDance Seed · Китай
Компактный переводчик ByteDance на 28 языков, по качеству близкий к крупным закрытым системам. Русский есть. Есть готовые сжатые версии.
- Перевод деловой переписки и документов
- Перевод карточек товаров
- Перевод технических и юридических текстов
- Размеры
- 7B
- Железо
- от: Ноутбук
Примерка одежды2025
LavieAI и Университет Сунь Ятсена · Китай
Примерка сразу нескольких вещей за раз: верх, низ, обувь, сумка. Быстрее прежних моделей за счёт кэширования. Лицензия некоммерческая.
- Сборка образа из нескольких товаров на одной модели
- Пилот «собери лук» на сайте
- Прототипы лукбуков без съёмки
- Размеры
- на базе SD 1.5 inpainting
- Железо
- от: 1 видеокарта
Обработка фото2024–2025
Нанькайский университет · Китай
Открытая модель точного выделения объекта и удаления фона под лицензией MIT. На ней построен RMBG-2.0. Есть версии для 2K и для волос и полупрозрачных краёв.
- Удаление фона с фото товаров потоком
- Точные маски для дизайна и печати
- Вырезка людей с волосами для рекламы
- Размеры
- около 220M (есть облегчённые lite)
- Железо
- от: Ноутбук
Картинки2024–2025
BAAI (Пекинская академия ИИ) · Китай
Универсальная модель: генерирует, редактирует, переносит объект или человека с фото в новую сцену без отдельных плагинов.
- Перенос товара или человека в новую сцену
- Редактирование фото по инструкции
- Генерация по нескольким референсам
- Размеры
- около 4B
- Железо
- от: 1 видеокарта
Математика и рассуждения2025
NVIDIA · США
Модели NVIDIA для математики и рассуждений на базе Qwen. AceReason дообучена с подкреплением сначала на математике, потом на коде.
- Расчёты и проверка формул
- Сложная аналитика с пошаговым разбором
- Разбор задач по программированию
- Размеры
- 1.5B – 72B
- Железо
- от: Ноутбук
Роботы2025
Hugging Face · США
Маленькая модель управления роботом, которая работает на обычном ноутбуке. Обучена на открытых данных сообщества LeRobot, подходит для недорогих манипуляторов.
- Управление недорогим манипулятором
- Быстрые пилоты и демо роботизации
- Обучение персонала и студентов
- Размеры
- 450M
- Железо
- от: Ноутбук
Перевод2024–2025
Unbabel · Португалия
Языковые модели, заточенные под перевод и работу с многоязычными текстами: перевод, правка, оценка качества перевода. Русский есть. Некоммерческая лицензия.
- Перевод с учётом контекста и терминов
- Редактура машинного перевода
- Оценка качества готового перевода
- Размеры
- 2B – 72B
- Железо
- от: Ноутбук
Обработка фото2025
ByteDance Seed · Китай
Восстановление и увеличение видео и фото от ByteDance. SeedVR2 делает это за один шаг, поэтому заметно быстрее похожих моделей. Коммерческая лицензия.
- Увеличение фото и видео до 2K–4K
- Восстановление старых роликов и снимков
- Улучшение пользовательских фото перед публикацией
- Размеры
- 3B – 7B
- Железо
- от: 1 видеокарта
Картинка + текст2025
Moonshot AI · Китай
Экономичная MoE-модель зрения (16B, активны 3B) с длинным контекстом и рассуждающей версией. Хорошо разбирает длинные документы и видео.
- Разбор длинных PDF и презентаций
- Ответы на вопросы по видео
- Работа с интерфейсами по скриншотам
- Размеры
- 16B-A3B
- Железо
- от: 1 видеокарта
Текст2025
DeepSeek · Китай
Рассуждающая модель: думает по шагам перед ответом. Сильна в расчётах, логике и коде; есть компактные дистиллированные версии.
- Сложные расчёты и проверка логики
- Анализ договоров и регламентов
- Помощь программистам
- Размеры
- 1,5B – 671B
- Железо
- от: 1 видеокарта
Код2025
ByteDance Seed · Китай
Компактная модель для кода 8B от ByteDance: базовая, инструктивная и рассуждающая версии. Данные для обучения отбирала сама модель, почти без ручных правил.
- Автодополнение и генерация кода
- Решение алгоритмических задач
- Основа для дообучения под свой стек
- Размеры
- 8B
- Железо
- от: Ноутбук
Картинки2025
ByteDance Seed · Китай
Единая модель, которая и понимает картинки, и генерирует, и редактирует их по диалогу. Похожа на то, как работают картинки в ChatGPT.
- Редактирование фото в диалоге
- Ответы на вопросы по изображению
- Генерация картинок с пояснениями
- Размеры
- 14B-A7B
- Железо
- от: 1 видеокарта
Аватары2025
Tencent · Китай
Говорящие персонажи на базе HunyuanVideo: передаёт эмоции голоса, работает с несколькими персонажами и разными стилями.
- Видео с ведущим по фото и аудио
- Сцены с несколькими говорящими
- Мультяшные персонажи
- Размеры
- около 13B
- Железо
- от: 1 видеокарта
Разбор текста2023–2025
deepvk (VK) · Россия
Русские энкодеры от команды VK: RuModernBERT читает длинные тексты, USER даёт векторы для поиска, GeRaCl классифицирует тексты по темам без обучения.
- Классификация обращений без размеченных данных
- Поиск по базе знаний на русском
- Разбор длинных договоров
- Размеры
- 35M – 360M
- Железо
- от: Ноутбук
Текст2023–2025
Meta · США
Модели, с которых начался массовый open source в ИИ. Огромная экосистема дообученных версий и инструментов.
- Ассистент для сотрудников
- Суммаризация встреч и документов
- Основа для дообучения под отрасль
- Размеры
- 1B – 405B
- Железо
- от: Ноутбук
Математика и рассуждения2024–2025
DeepSeek · Китай
Модели DeepSeek для формальных доказательств на языке Lean 4: доказательство проверяет программа, а не человек. Узкий инструмент для математиков и инженеров.
- Формальная проверка математических выкладок
- Проверка корректности алгоритмов
- Обучение и олимпиадная подготовка
- Размеры
- 7B – 671B
- Железо
- от: Ноутбук
Текст2023–2025
Илья Гусев (IlyaGusev) · Россия
Самая известная русскоязычная доучка сообщества: чужие открытые модели (Llama, Mistral, Gemma, YandexGPT) дообучены отвечать на русском как ассистент. Удобная отправная точка для русского чат-бота на своём сервере.
- Чат-ассистент на русском языке
- Ответы на вопросы по базе знаний компании
- Черновики писем, описаний и постов на русском
- Размеры
- 7B – 70B
- Железо
- от: Ноутбук
Модерация и безопасность2023–2025
Meta · США
Модели-фильтры, которые проверяют запросы к чат-боту и его ответы на опасные темы по списку категорий. Версия 4 проверяет и картинки. Русский официально не заявлен.
- Проверка вопросов пользователей к боту
- Проверка ответов бота перед отправкой
- Отчёт, какая категория правил нарушена
- Размеры
- 1B – 12B
- Железо
- от: Ноутбук
Модерация и безопасность2024–2025
Meta · США
Крошечные классификаторы, которые ловят попытки взломать бота: промпт-инъекции и обход правил. Версия 86M многоязычная, 22M только английский.
- Защита бота от промпт-инъекций
- Проверка писем и документов, которые попадают в ИИ-агента
- Быстрый фильтр перед большой моделью
- Размеры
- 22M – 86M
- Железо
- от: Ноутбук
Примерка одежды2024–2025
Университет Сунь Ятсена и Pixocial · Китай
Лёгкая модель примерки, запускается на обычной видеокарте. Есть версия без маски и CatV2TON, который примеряет одежду и на видео.
- Примерка вещи на фото покупателя
- Черновые карточки товара на модели
- Примерка на коротком видео
- Размеры
- 899M
- Железо
- от: Ноутбук
Картинка + текст2024–2025
Hugging Face · Франция / США
Самые маленькие модели зрения Hugging Face: от 256M, работают в браузере и на телефоне. SmolVLM2 понимает и видео.
- Описание фото и видео на слабом железе
- Чтение простых документов
- Встраивание в мобильные и офлайн-приложения
- Размеры
- 256M – 2.2B
- Железо
- от: Ноутбук
Картинки2024–2025
NVIDIA · США
Быстрая модель картинок от NVIDIA: 4K-изображения за секунды и работа даже на ноутбучной видеокарте. Версия Sprint генерирует в 1–2 шага.
- Массовая генерация картинок
- Визуалы высокого разрешения
- Генерация в реальном времени в приложениях
- Размеры
- 0.6B – 4.8B
- Железо
- от: Ноутбук
Видео2024–2025
HPC-AI Tech · Сингапур
Полностью открытый проект видеогенерации: веса, код и рецепт обучения. Версия 2.0 на 11B делает видео из текста и из картинки.
- Видео по текстовому описанию
- Оживление картинок
- Обучение своей видеомодели
- Размеры
- до 11B
- Железо
- от: 1 видеокарта
Видео2025
StepFun · Китай
Крупная видеомодель на 30B с роликами до 204 кадров. Требует серверного железа, зато открыта под MIT.
- Видео по описанию
- Оживление изображений
- Размеры
- 30B
- Железо
- от: Кластер
Аватары2024–2025
Tencent Music (Lyra Lab) · Китай
Синхронизация губ в реальном времени: подгоняет рот на видео под новое аудио. Подходит для перевода видео и живых аватаров.
- Дубляж видео на другой язык
- Живой аватар в видеочате
- Правка речи в готовом ролике
- Размеры
- меньше 1B
- Железо
- от: Ноутбук
Математика и рассуждения2024–2025
Qwen (Alibaba) · Китай
Первая открытая рассуждающая модель Qwen: думает по шагам перед ответом и на задачах по математике близка к DeepSeek-R1 при 32B параметров.
- Расчёты и проверка формул
- Сложная аналитика с пошаговым разбором
- Проверка логики договоров и регламентов
- Размеры
- 32B
- Железо
- от: 1 видеокарта
Математика и рассуждения2025
Стэнфордский университет · США
Рассуждающая модель, обученная всего на тысяче задач. Умеет думать дольше по команде, чтобы точнее ответить на сложный вопрос.
- Расчёты и проверка формул
- Разбор сложных задач по шагам
- Обучение
- Размеры
- 1.5B – 32B
- Железо
- от: Ноутбук
Математика и рассуждения2025
Qihoo 360 · Китай
Рассуждающие модели Qihoo 360: обычную Qwen2.5 дообучили длинным рассуждениям по открытому рецепту, данные и код выложены.
- Расчёты и проверка формул
- Разбор задач по шагам
- Основа для своего дообучения рассуждениям
- Размеры
- 7B – 32B
- Железо
- от: Ноутбук
Поиск и RAG2024–2025
Nomic AI · США
Полностью открытые эмбеддинги — с весами, данными и кодом обучения. v2 многоязычная на MoE, есть версии для кода и для поиска по PDF-страницам.
- Поиск по документам и базе знаний
- Поиск по коду
- Поиск по сканам и PDF без распознавания
- Размеры
- 137M – 7B
- Железо
- от: Ноутбук
Синтез речи2023–2025
Rhasspy / Open Home Foundation · США
Очень быстрый синтез речи, который работает даже на Raspberry Pi. Готовые голоса на 35+ языках, есть несколько русских.
- Озвучка уведомлений и ответов бота
- Голос для устройств без интернета
- Голосовые меню
- Размеры
- около 5M – 30M
- Железо
- от: Ноутбук
Синтез речи2024–2025
Шанхайский университет Цзяотун и партнёры · Китай
Модель клонирования голоса по нескольким секундам образца, английский и китайский. Сообщество выпустило много дообученных версий под другие языки, в том числе русский.
- Клонирование голоса
- Озвучка аудиокниг и роликов
- Исследования и прототипы
- Размеры
- около 340M
- Железо
- от: Ноутбук
Синтез речи2025
Canopy Labs · США
Синтез речи на основе языковой модели с живыми интонациями и эмоциональными вставками. Быстро отвечает, подходит для голосовых ассистентов. В основном английский.
- Голос для ассистента в реальном времени
- Эмоциональная озвучка
- Клонирование голоса
- Размеры
- 3B
- Железо
- от: Ноутбук
Синтез речи2025
Sesame · США
Модель разговорной речи, которая учитывает контекст беседы и звучит как живой собеседник. Только английский.
- Голос для разговорного ассистента
- Озвучка диалогов
- Прототипы голосовых продуктов
- Размеры
- 1B
- Железо
- от: Ноутбук
Модерация и безопасность2024–2025
Google · США
Фильтры на базе Gemma: проверяют текст на опасный и оскорбительный контент, а ShieldGemma 2 проверяет картинки. Ориентированы на английский.
- Модерация сообщений пользователей
- Проверка ответов бота
- Проверка сгенерированных картинок перед публикацией
- Размеры
- 2B – 27B
- Железо
- от: Ноутбук
Математика и рассуждения2025
NovaSky (Sky Computing Lab, Беркли) · США
Рассуждающая модель из Беркли, обученная меньше чем за 450 долларов. Показала, что рассуждения уровня o1-preview можно повторить малыми силами.
- Расчёты и проверка формул
- Разбор задач по шагам
- Основа для своего дообучения рассуждениям
- Размеры
- 7B – 32B
- Железо
- от: Ноутбук
Компьютерное зрение2023–2025
Google · США
Модели, которые переводят картинки и текст в общее пространство: можно искать фото по словам и классифицировать изображения без обучения. CLIP от OpenAI (2021) — предшественник.
- Поиск картинок по текстовому запросу
- Автоматическая разметка и теги каталога
- Фильтрация недопустимого контента
- Размеры
- около 0.2B – 2B
- Железо
- от: Ноутбук
Роботы2024–2025
Стэнфорд, Беркли и партнёры · США
Первая крупная открытая модель «зрение-язык-действие»: робот-манипулятор выполняет команды вроде «положи яблоко в миску». OFT ускоряет её в разы.
- Управление манипулятором по текстовой команде
- Пилоты по роботизации простых операций
- Основа для дообучения под свой робот
- Размеры
- 7B
- Железо
- от: 1 видеокарта
Текст2023–2025
Ai2 · США
Дообучения Llama от Ai2 с полностью открытым рецептом: данные, код и все промежуточные этапы. Tulu 3 на 405B — одна из самых крупных открыто дообученных моделей; по этому же рецепту делают чат-версии OLMo.
- Ассистент для сотрудников на своём сервере
- Математика и точное следование инструкциям
- Образец рецепта для собственного дообучения
- Размеры
- 7B – 405B
- Железо
- от: Ноутбук
Синтез речи2024–2025
hexgrad (независимый разработчик) · не указана
Крошечная модель синтеза речи (82M), которая звучит на уровне крупных. Работает на обычном процессоре; английский и ещё несколько языков, русского нет.
- Озвучка статей и уведомлений
- Голос для приложений без видеокарты
- Массовая озвучка текстов
- Размеры
- 82M
- Железо
- от: Ноутбук
Примерка одежды2025
Пекинский университет почты и связи и др. · Китай
Универсальный набор для одежды на базе FLUX: примерка, генерация модели в заданной вещи и «снятие» вещи с человека в отдельное фото товара.
- Примерка по фото товара
- Фото модели в вещи по текстовому описанию
- Чистое фото вещи со снимка человека
- Размеры
- дополнения (LoRA) к FLUX.1 dev 12B
- Железо
- от: 1 видеокарта
Математика и рассуждения2024–2025
Qwen (Alibaba) · Китай
Математические версии Qwen: решают задачи по шагам и умеют считать через код. Есть модели-оценщики, которые проверяют каждый шаг решения.
- Расчёты и проверка формул
- Проверка расчётов в сметах и отчётах
- Разбор задач по шагам
- Размеры
- 1.5B – 72B
- Железо
- от: Ноутбук
3D2024–2025
Stability AI · Великобритания
Модели Stability AI, которые за секунду превращают одну фотографию в 3D-модель с текстурой. SPAR3D позволяет поправить форму через облако точек.
- 3D-карточки товаров по фото
- Ассеты для игр и AR
- Быстрые макеты для дизайна
- Размеры
- 1B – 2B
- Железо
- от: 1 видеокарта
Поиск и RAG2023–2025
Alibaba · Китай
Эмбеддинги и реранкеры Alibaba для поиска: от крошечных до 7B на базе Qwen2. Есть многоязычная версия mGTE с длинным контекстом.
- Смысловой поиск по документам
- Переранжирование результатов поиска
- Кластеризация и классификация текстов
- Размеры
- 33M – 7B
- Железо
- от: Ноутбук
Разбор текста2024–2025
Answer.AI и LightOn · США / Франция
Современная замена классическому BERT: быстрее, читает до 8 тысяч токенов за раз. Основа для своих классификаторов. Обучена на английском и коде, для русского есть RuModernBERT.
- Классификация обращений и документов
- Поиск нужных фрагментов в длинных текстах
- Основа для своего классификатора после дообучения
- Размеры
- 150M – 395M
- Железо
- от: Ноутбук
Обработка фото2024–2025
Prama LLC · США
Модель удаления фона с упором на сложные края: волосы, мех, тонкие детали. Открытая версия под MIT, умеет обрабатывать видео.
- Вырезка товара и людей с фото
- Удаление фона на видео
- Подготовка фото для каталога
- Размеры
- около 95M
- Железо
- от: Ноутбук
Картинка + текст2024–2025
DeepSeek · Китай
Одна модель и понимает картинки, и рисует их по описанию. Janus-Pro-7B была заметна в начале 2025 года, но по качеству картинок уступает специализированным моделям.
- Ответы на вопросы по картинкам
- Черновые иллюстрации по описанию
- Эксперименты с единой моделью зрения и генерации
- Размеры
- 1B – 7B
- Железо
- от: Ноутбук
Примерка одежды2024
Meta AI (вместе с King's College London) · США
Модель Meta для примерки и смены позы человека на фото. Бережно переносит мелкие детали ткани и надписи. Лицензия MIT, но обучающие данные некоммерческие.
- Примерка одежды на фото модели
- Смена позы модели на уже снятом кадре
- Добор ракурсов для карточки товара
- Размеры
- на базе Stable Diffusion
- Железо
- от: 1 видеокарта
Примерка одежды2024
Tencent и Фуданьский университет · Китай
Примерка на трансформере от Tencent: точнее передаёт фактуру ткани, мелкий принт и длину вещи. Лицензия некоммерческая.
- Примерка вещей со сложным принтом и фактурой
- Карточки товара на модели для тестов
- Подбор длины и посадки на фото
- Размеры
- на базе SD3
- Железо
- от: 1 видеокарта
Видео2024
Zhipu AI (Z.ai) и Университет Цинхуа · Китай
Модель видео на 2–5B, которая запускается на одной игровой видеокарте. Популярная база для исследований и надстроек.
- Короткие ролики из текста
- Оживление изображений
- Эксперименты с дообучением видео
- Размеры
- 2B – 5B
- Железо
- от: 1 видеокарта
Синтез речи2024
Hugging Face · США
Синтез речи, где голос задаётся текстовым описанием («спокойный женский голос, чистая запись»). Английский и 8 европейских языков, русского нет.
- Подбор голоса по описанию
- Озвучка роликов
- Прототипы голосовых сервисов
- Размеры
- 880M – 2.2B
- Железо
- от: Ноутбук
Музыка и звук2023–2024
Meta · США
Генерация инструментальной музыки по текстовому описанию или по мелодии-образцу. Одна из первых открытых моделей такого рода.
- Черновые музыкальные наброски
- Музыка для прототипов роликов
- Исследования
- Размеры
- 300M – 3.3B
- Железо
- от: Ноутбук
Картинка + текст2024
Google · США
Модель зрения Google на базе Gemma, задуманная как основа для дообучения под узкую задачу: подписи, поиск объектов, чтение текста.
- Дообучение под свою задачу распознавания
- Поиск объектов на фото
- Чтение текста на изображениях
- Размеры
- 3B – 28B
- Железо
- от: Ноутбук
Документы и OCR2024
StepFun · Китай
Одна из первых универсальных OCR-моделей нового поколения: текст, формулы, таблицы, ноты и схемы. Маленькая, работает на слабом железе, но уже уступает новинкам.
- Распознавание сканов счетов и договоров
- Перевод таблиц в редактируемый вид
- Распознавание формул и схем
- Размеры
- 580M
- Железо
- от: Ноутбук
Речь в текст2022–2024
OpenAI · США
Распознавание речи на 99 языках, включая русский. Стандарт де-факто для расшифровки звонков и встреч.
- Расшифровка звонков и созвонов
- Субтитры к видео
- Голосовые сообщения в текст
- Размеры
- 39M – 1,5B
- Железо
- от: Ноутбук
Картинки2022–2024
Stability AI · Великобритания
Модель, с которой началась открытая генерация картинок. Огромная экосистема дообучений, стилей и плагинов, работает даже на домашнем ПК.
- Иллюстрации и баннеры для рекламы
- Фоны и сцены для карточек товаров
- Дообучение под фирменный стиль
- Размеры
- 0.9B – 8B
- Железо
- от: Ноутбук
Видео2024
Genmo · США
Открытая видеомодель на 10B с реалистичным движением. На момент выхода была одной из сильнейших открытых, сейчас обновлений нет.
- Видео по описанию
- Короткие рекламные сцены
- Размеры
- 10B
- Железо
- от: 1 видеокарта
Код2023–2024
DeepSeek · Китай
Линейка моделей для кода от DeepSeek: от маленьких для автодополнения до большой MoE V2, которая в 2024 году была на уровне закрытых моделей. Позже код ушёл в общие модели DeepSeek.
- Автодополнение и генерация кода
- Перевод кода между языками
- Поиск ошибок и объяснение чужого кода
- Размеры
- 1.3B – 236B-A21B
- Железо
- от: Ноутбук
Модерация и безопасность2024
iiiorg · не указана
Популярный детектор 17 типов персональных данных на шести европейских языках. Русского нет, лицензия некоммерческая — подходит для проб и исследований.
- Поиск персональных данных в текстах
- Сравнение качества детекторов PII
- Размеры
- 278M
- Железо
- от: Ноутбук
Обработка фото2024
Jasper AI · США
Дополнение к FLUX для увеличения маленьких и размытых картинок с дорисовкой деталей. Популярно, но под некоммерческой лицензией FLUX dev.
- Увеличение мелких картинок с дорисовкой
- Улучшение сгенерированных изображений
- Пилоты апскейла для каталога
- Размеры
- дополнение к FLUX.1 dev 12B
- Железо
- от: 1 видеокарта
Перевод2023–2024
Университет Джонса Хопкинса и Microsoft · США
Исследовательские переводчики на основе Llama 2. Первая ALMA знала 5 пар с английским, включая русский; X-ALMA расширила охват до 50 языков.
- Перевод между английским и русским
- Эксперименты с переводом на базе языковых моделей
- Основа для дообучения переводчика
- Размеры
- 7B – 13B
- Железо
- от: 1 видеокарта
Картинка + текст2023–2024
Hugging Face · Франция / США
Открытые модели зрения от Hugging Face, воспроизводившие закрытую Flamingo. Idefics3 стала основой для компактной линейки SmolVLM.
- Ответы на вопросы по картинкам
- Разбор документов и скриншотов
- Основа для дообучения
- Размеры
- 8B – 80B
- Железо
- от: 1 видеокарта
Код2024
Mistral AI · Франция
Модель Mistral для кода на 80+ языках программирования. Открытые веса основной версии нельзя использовать в работе без платной лицензии; новые версии Codestral только по API.
- Оценка и тесты перед покупкой лицензии
- Автодополнение кода (при коммерческой лицензии)
- Исследование качества моделей для кода
- Размеры
- 7B – 22B
- Железо
- от: Ноутбук
Картинки2023–2024
Лвминь Чжан (Стэнфорд) и сообщество · США
Надстройка над моделями картинок: задаёт позу, контуры, глубину или планировку, чтобы результат точно повторял нужную композицию.
- Картинка по эскизу или контуру
- Сохранение позы и композиции
- Визуализация интерьеров по планировке
- Размеры
- 0.4B – 1.3B
- Железо
- от: Ноутбук
Видео2023–2024
Shanghai AI Lab и CUHK · Китай
Модуль, который оживляет модели картинок Stable Diffusion и превращает их в короткую анимацию. Одна из первых открытых видеотехнологий.
- Короткие анимации в фирменном стиле
- Живые обложки и баннеры
- Анимированные стикеры
- Размеры
- модуль движения поверх SD 1.5 / SDXL
- Железо
- от: Ноутбук
Аватары2024
Kuaishou (Kling) · Китай
Оживляет портрет по видео-образцу: мимика и повороты головы переносятся с актёра на фото. Быстро работает даже на слабой видеокарте.
- Оживление портретов
- Перенос мимики актёра на персонажа
- Анимация маскотов
- Размеры
- меньше 1B
- Железо
- от: Ноутбук
Медицина2023–2024
M42 Health · ОАЭ
Клинические модели абу-дабийской M42 на основе Llama, настроенные отвечать на медицинские вопросы. Не заменяет врача, решения принимает специалист.
- Справочные ответы персоналу по клиническим вопросам
- Черновики выписок и писем для проверки врачом
- Поиск по медицинской литературе
- Размеры
- 8B – 70B
- Железо
- от: Ноутбук
Разбор текста2020–2024
SberDevices (ai-forever) · Россия
Русскоязычные энкодеры Сбера, обученные на больших русских корпусах. Основа для классификаторов, NER и поиска по смыслу на русском.
- Классификация обращений на русском
- Извлечение имён, сумм и дат после дообучения
- Определение тональности отзывов
- Размеры
- около 30M – 430M
- Железо
- от: Ноутбук
Модерация и безопасность2024
Ai2 (Allen Institute for AI) · США
Открытый фильтр Ai2: одним проходом определяет, опасен ли запрос, опасен ли ответ и не отказал ли бот зря. Работает на английском.
- Проверка запросов к боту
- Проверка ответов бота
- Поиск лишних отказов бота на безобидные вопросы
- Размеры
- 7B
- Железо
- от: 1 видеокарта
Картинка + текст2024
Microsoft · США
Очень маленькая модель зрения: подписи, поиск объектов, сегментация и чтение текста по одной команде. Работает даже на процессоре.
- Чтение текста на фото
- Поиск и выделение объектов
- Автоматические подписи к фото
- Размеры
- 0.23B – 0.77B
- Железо
- от: Ноутбук
Текст2023–2024
OpenChat (Университет Цинхуа) · Китай
Дообучения Mistral 7B и Llama 3 8B по методу C-RLFT, которые в 2023–2024 годах догоняли ChatGPT-3.5 при размере 7–8B. Лёгкий универсальный ассистент для слабого сервера.
- Чат-ассистент на недорогом сервере
- Черновики писем и ответов
- Помощь с простым кодом
- Размеры
- 7B – 13B
- Железо
- от: Ноутбук
Текст2023–2024
01.AI · Китай
Двуязычные (английский и китайский) модели 01.AI на 6–34B с версиями на контекст до 200 тыс. токенов. Новых открытых выпусков с 2024 года нет.
- Чат-ассистент на одной видеокарте
- Разбор длинных документов
- Классификация и извлечение данных из текста
- Размеры
- 6B – 34B
- Железо
- от: Ноутбук
Обработка фото2023–2024
Shanghai AI Laboratory (OpenMMLab) и Университет Цинхуа · Китай
Универсальная дорисовка фото: убрать объект, вставить новый по описанию, заменить форму или расширить кадр за края.
- Удаление и замена объектов на фото
- Расширение кадра под нужный формат
- Вставка товара или детали по текстовому описанию
- Размеры
- на базе SD 1.5
- Железо
- от: Ноутбук
Обработка фото2024
Лвмин Чжан (автор ControlNet) · США
Меняет освещение на фото: ставит объект или человека в новый свет по описанию или под заданный фон, чтобы вырезка смотрелась естественно.
- Подгонка света товара под новый фон
- Студийный свет для портретов без пересъёмки
- Единый стиль освещения в каталоге
- Размеры
- на базе SD 1.5
- Железо
- от: Ноутбук
Код2023–2024
BigCode (Hugging Face и ServiceNow) · США / Франция
Одна из первых открытых моделей для кода, обучена на открытом наборе исходников с возможностью исключить свой репозиторий. Сегодня скорее база для дообучения, чем лидер.
- Автодополнение кода в редакторе
- Дообучение на внутреннем коде компании
- Генерация шаблонного кода и тестов
- Размеры
- 1B – 15B
- Железо
- от: Ноутбук
Картинки2023–2024
Huawei Noah's Ark Lab и партнёры · Китай
Компактная модель картинок на 0.6B с качеством уровня крупных. Умеет 4K в версии Sigma, подходит для скромного железа.
- Иллюстрации для статей и соцсетей
- Фоны для карточек товаров
- Быстрые черновики визуалов
- Размеры
- 0.6B
- Железо
- от: Ноутбук
Медицина2024
Авиньонский университет и Нантский университет · Франция
Mistral 7B, дообученная на статьях PubMed Central, плюс несколько слияний с общей моделью. Компактная и простая в запуске. Не заменяет врача, решения принимает специалист.
- Поиск и пересказ медицинских статей
- Черновики справочных материалов для персонала
- Разбор медицинской терминологии
- Размеры
- 7B
- Железо
- от: Ноутбук
Медицина2024
Saama AI Research · Индия
Llama 3, дообученная на медицинских и биологических данных. Одна из первых сильных открытых медицинских моделей 2024 года. Не заменяет врача, решения принимает специалист.
- Извлечение данных из медицинских документов
- Черновики выписок для проверки врачом
- Поиск по медицинской литературе
- Размеры
- 8B, 70B
- Железо
- от: Ноутбук
3D2024
Tencent ARC · Китай
Делает 3D-сетку по одной картинке примерно за 10 секунд: сначала рисует объект с нескольких ракурсов, потом собирает из них модель.
- 3D-модель объекта по фото
- Заготовки для игр и визуализаций
- Прототипы для 3D-печати
- Размеры
- н/д
- Железо
- от: 1 видеокарта
Текст2023–2024
Hugging Face (H4) · США
Учебные чат-модели Hugging Face на базе Mistral, Gemma и Mixtral с открытым рецептом дообучения. Zephyr 7B Beta показал, что маленькую модель можно «воспитать» до уровня крупных без ручной разметки людьми.
- Лёгкий чат-ассистент
- Образец и отправная точка для своего дообучения
- Черновики текстов и ответов
- Размеры
- 7B – 141B-A35B
- Железо
- от: Ноутбук
Примерка одежды2024
KAIST и OMNIOUS.AI · Южная Корея
Одна из самых известных открытых примерок: переносит вещь с фото товара на фото человека, хорошо держит принты и логотипы. Лицензия некоммерческая.
- Пилот примерочной на сайте магазина
- Прототип карточек товара на модели без фотосессии
- Сравнение с коммерческими сервисами примерки
- Размеры
- на базе SDXL
- Железо
- от: 1 видеокарта
Текст2023–2024
Сбер (ai-forever) · Россия
Русская модель «текст в текст» от Сбера, наследница ruT5 (2021). Небольшая и быстрая: её дообучают на пересказ, перефразирование и исправление ошибок в русском тексте, есть готовые версии проверки орфографии SAGE.
- Исправление орфографии и опечаток в русском тексте
- Краткий пересказ и перефразирование
- Нормализация заявок и обращений перед обработкой
- Размеры
- 95M – 1.7B
- Железо
- от: Ноутбук
Примерка одежды2024
Xiao-i Research · Китай
Ранняя популярная открытая примерка: одна версия для верхней одежды по пояс, другая для образа в полный рост. Лицензия некоммерческая.
- Примерка верха на фото модели
- Примерка в полный рост: верх, низ, платья
- Прототип примерочной для тестов
- Размеры
- на базе Stable Diffusion
- Железо
- от: 1 видеокарта
Картинки2023–2024
Playground AI · США
Модель на архитектуре SDXL с упором на эстетику: яркие цвета, контраст, портреты. Совместима с инструментами экосистемы SDXL.
- Эстетичные рекламные визуалы
- Портреты и лайфстайл-картинки
- Обложки для постов
- Размеры
- около 2.6B
- Железо
- от: 1 видеокарта
Поиск и RAG2022–2024
Microsoft · США
Проверенные модели для смыслового поиска. Многоязычные версии хорошо работают с русским и до сих пор служат надёжной основой для RAG.
- Поиск по базе знаний и документам
- Подбор ответов для чат-бота (RAG)
- Поиск похожих обращений и дублей
- Размеры
- 33M – 7B
- Железо
- от: Ноутбук
Прогнозы2024
ServiceNow, Mila и партнёры · Канада
Одна из первых открытых моделей прогнозов «из коробки». Крошечная, даёт вероятностный прогноз, сейчас уступает Chronos и TimesFM.
- Вероятностный прогноз продаж
- Быстрые пилоты прогнозирования
- Базовая модель для сравнения
- Размеры
- 2.4M
- Железо
- от: Ноутбук
Примерка одежды2024
KAIST · Южная Корея
Исследовательская модель примерки с конференции CVPR 2024, одна из первых на базе Stable Diffusion. Сейчас чаще служит точкой сравнения.
- Пилот примерки верхней одежды
- Сравнение качества разных моделей примерки
- Обучение своей примерки на базе открытого кода
- Размеры
- на базе Stable Diffusion
- Железо
- от: 1 видеокарта
Обработка фото2024
XPixel Group (Шэньчжэньский институт передовых технологий АН Китая, Shanghai AI Lab и др.) · Китай
Мощное восстановление сильно испорченных фото на базе SDXL: дорисовывает детали, а не просто увеличивает. Требовательна к железу, лицензия некоммерческая.
- Восстановление старых и размытых фото
- Увеличение снимков с дорисовкой деталей
- Пилоты реставрации архивов
- Размеры
- на базе SDXL, плюс LLaVA 13B для описаний
- Железо
- от: 1 видеокарта
Поиск и RAG2024
BAAI · Китай
Модель для поиска по смыслу на сотне языков. Основа RAG: бот находит нужный кусок документа перед ответом.
- Поиск по базе документов
- RAG для чат-бота
- Поиск похожих обращений и дублей
- Размеры
- 568M
- Железо
- от: Ноутбук
Код2023–2024
Meta · США
Версия Llama 2, доученная на коде; есть варианты для Python и для диалога. Устарела, но много готовых дообученных версий и инструментов.
- Автодополнение и объяснение кода
- Генерация скриптов на Python
- Базовая модель для дообучения под свой стек
- Размеры
- 7B – 70B
- Железо
- от: Ноутбук
Текст2023–2024
WizardLM (Microsoft и Пекинский университет) · США / Китай
Дообучения Llama, Mistral и StarCoder методом Evol-Instruct — автоматическим усложнением инструкций. WizardLM-2 выложили в апреле 2024 и почти сразу удалили, поэтому актуальны только версии 2023 года.
- Сложные многошаговые инструкции
- Помощь программистам
- Решение математических задач
- Размеры
- 7B – 70B
- Железо
- от: Ноутбук
Обработка фото2023
Alibaba DAMO Academy · Китай
Окрашивание чёрно-белых фото в естественные цвета. Лёгкая модель с коммерческой лицензией, есть компактная версия tiny.
- Окрашивание архивных фото
- Цветные версии исторических снимков для публикаций
- Сервис оживления семейных фото
- Размеры
- DDColor-T (tiny) и DDColor-L
- Железо
- от: Ноутбук
Видео2023
Stability AI · Великобритания
Первая открытая модель Stability AI для видео: оживляет фото в ролик на 2–4 секунды. Сейчас уступает новым моделям по качеству.
- Оживление фото товара
- Короткие видеозаставки
- Анимация иллюстраций
- Размеры
- около 1.5B
- Железо
- от: 1 видеокарта
Синтез речи2023
Колумбийский университет · США
Лёгкая модель синтеза английской речи с естественной интонацией. На её основе построены многие другие модели, например Kokoro.
- Озвучка текстов на английском
- Основа для дообучения своего голоса
- Прототипы голосовых сервисов
- Размеры
- около 150M
- Железо
- от: Ноутбук
Голосовые ассистенты2023
Meta · США
Перевод речи и текста примерно между сотней языков, включая русский: речь в текст, речь в речь, потоковый перевод с сохранением интонации.
- Перевод речи в речь
- Перевод и расшифровка записей
- Потоковый перевод
- Размеры
- 281M – 2.3B
- Железо
- от: Ноутбук
Перевод2023
Google · США
Переводчик Google более чем на 400 языков под свободной лицензией. Русский есть. Хорошая замена NLLB, когда нужна коммерция.
- Перевод документов и писем
- Перевод каталогов и описаний товаров
- Перевод на языки стран СНГ и Азии
- Размеры
- 3B – 10B
- Железо
- от: Ноутбук
Синтез речи2023
Coqui · Германия
Популярная модель клонирования голоса по короткому образцу на 17 языках, включая русский. Компания Coqui закрылась, развитие остановлено.
- Клонирование голоса по образцу
- Озвучка на нескольких языках
- Исследования и прототипы
- Размеры
- около 470M
- Железо
- от: Ноутбук
Обработка фото2022–2023
Ким Тэхун (POSTECH) · Южная Корея
Модель выделения главного объекта и готовая программа transparent-background на её основе: убирает фон с фото, видео и веб-камеры одной командой.
- Пакетное удаление фона с фото
- Замена фона на цвет или размытие
- Удаление фона на видео
- Размеры
- небольшая (на базе Swin-B)
- Железо
- от: Ноутбук
Документы и OCR2023
Meta · США
Ранняя модель, переводящая научные PDF в текст с формулами. Сегодня устарела, её обходят почти все современные OCR-модели.
- Перевод научных статей из PDF в текст с формулами
- Оцифровка технической документации
- Размеры
- 250M – 350M
- Железо
- от: Ноутбук
Медицина2023
Лаборатория Бо Ванга (Университет Торонто, Vector Institute) · Канада
Ранняя медицинская модель на Llama 2 70B, обученная на диалогах по медицинским текстам. Сейчас интересна в основном для исследований. Не заменяет врача, решения принимает специалист.
- Исследовательские пилоты по медицинским диалогам
- Учебные материалы для персонала
- Сравнение с новыми медицинскими моделями
- Размеры
- 70B
- Железо
- от: 1 видеокарта
Медицина2023
Шанхайский университет Цзяо Тун и Shanghai AI Lab · Китай
Ранняя общая модель для радиологии: понимает 2D- и 3D-снимки (КТ, МРТ) вместе с текстом. Скорее исследовательская база. Не заменяет врача, решения принимает специалист.
- Исследовательские пилоты по разбору КТ и МРТ
- Подсказки при разборе снимков для врача
- Основа для своего дообучения на снимках клиники
- Размеры
- размер на карточке не указан
- Железо
- от: 1 видеокарта
Текст2022–2023
Сбер (ai-forever) · Россия
Многоязычная модель Сбера на 61 язык, включая языки народов России и СНГ. Есть отдельные доучки под бурятский, якутский, татарский, башкирский, казахский и другие языки — редкость для открытых моделей.
- Тексты на языках народов России и СНГ
- Основа для дообучения под редкий язык
- Черновики и шаблоны на нескольких языках
- Размеры
- 1.3B – 13B
- Железо
- от: Ноутбук
Текст2023
LMSYS (Беркли и партнёры) · США
Одна из первых открытых чат-моделей 2023 года: LLaMA, дообученная на диалогах пользователей ChatGPT. Историческая веха, сегодня уступает любой современной модели того же размера.
- Эксперименты и обучение команды
- Простой чат-ассистент для тестов
- Сравнение с новыми моделями
- Размеры
- 7B – 33B
- Железо
- от: Ноутбук
Обработка фото2022–2023
XPixel Group (Шэньчжэньский институт передовых технологий АН Китая и др.) · Китай
Увеличение фото на трансформере, точнее SwinIR на тонких деталях. Есть версии для реальных снимков с шумом и лёгкая HAT-S.
- Увеличение фото товаров и интерьеров
- Подготовка изображений к печати
- Повышение чёткости архивных снимков
- Размеры
- 9M – 40M
- Железо
- от: Ноутбук
Аватары2023
Сианьский университет Цзяотун и Tencent AI Lab · Китай
Старая лёгкая модель говорящей головы: одно фото и аудио превращаются в видео. Работает на слабом железе, но качество заметно ниже новых.
- Говорящее фото для приветствия
- Простые озвученные аватары
- Размеры
- меньше 1B
- Железо
- от: Ноутбук
Текст2023
Сбер (ai-forever) · Россия
Базовая русскоязычная модель Сбера на 13 млрд параметров, из дообученной версии которой вырос GigaChat. Продолжает тексты на русском и английском, контекст всего 2048 токенов; сегодня интересна как основа для узкого дообучения.
- Основа для дообучения под узкую русскую задачу
- Генерация шаблонных русских текстов
- Эксперименты с русскоязычными моделями без ограничений лицензии
- Размеры
- 13B
- Железо
- от: 1 видеокарта
Синтез речи2023
Suno · США
Одна из первых открытых моделей, которая озвучивает текст с интонациями, смехом и паузами. Поддерживает около десятка языков, включая русский. Сейчас устарела.
- Черновая озвучка роликов
- Прототипы голосовых сервисов
- Звуковые эффекты в речи
- Размеры
- около 300M – 1B
- Железо
- от: Ноутбук
3D2022–2023
OpenAI · США
Ранние открытые модели OpenAI, которые делают 3D-объект по тексту или картинке за секунды. Качество простое, зато быстро и легко запускается.
- Черновые 3D-макеты по описанию
- Быстрые прототипы объектов для игр и AR
- Учебные и исследовательские пилоты по 3D
- Размеры
- 40M – 1B
- Железо
- от: Ноутбук
Обработка фото2023
S-Lab, Наньянский технологический университет · Сингапур
Одна из первых моделей увеличения фото на базе Stable Diffusion: восстанавливает реалистичные детали. Лицензия некоммерческая.
- Увеличение фото с дорисовкой деталей
- Исследовательские пилоты реставрации
- Сравнение с классическими апскейлерами
- Размеры
- на базе SD 2.1
- Железо
- от: 1 видеокарта
Картинки2023
DeepFloyd (Stability AI) · Великобритания
Ранняя модель, которая одной из первых научилась аккуратно писать текст на картинках. Сейчас интересна скорее как история, развитие остановлено.
- Исследовательские эксперименты
- Прототипы картинок с надписями
- Размеры
- 0.4B – 4.3B
- Железо
- от: 1 видеокарта
Обработка фото2022–2023
S-Lab, Наньянский технологический университет · Сингапур
Популярная реставрация лиц на старых и размытых фото, работает и с видео. Есть режимы дорисовки и окрашивания лица. Лицензия некоммерческая.
- Восстановление лиц на старых фото
- Улучшение лиц на видео низкого качества
- Пилоты реставрации семейных архивов
- Размеры
- небольшая, до 0.1B
- Железо
- от: Ноутбук
Текст2022–2023
Google · США
Компактные модели «вход-выход», обученные выполнять инструкции. До сих пор используются как дешёвая основа для классификации, извлечения и коротких ответов.
- Классификация обращений и документов
- Извлечение полей из текста
- Короткие ответы и пересказ
- Размеры
- 80M – 20B
- Железо
- от: Ноутбук
Перевод2022–2023
Meta · США
Переводчик на 200 языков, включая редкие и малые. Русский есть. Сильна по охвату языков, но лицензия запрещает коммерческое использование.
- Перевод текстов между 200 языками
- Перевод на редкие языки, где нет других моделей
- Сравнение качества при выборе переводчика
- Размеры
- 600M – 3.3B (и 54B MoE)
- Железо
- от: Ноутбук
Текст2022–2023
EleutherAI · США
Полностью открытые модели некоммерческой лаборатории EleutherAI: GPT-NeoX-20B и серия Pythia с опубликованными промежуточными снимками обучения.
- Базовая модель для дообучения
- Исследование поведения моделей
- Простая генерация и дополнение текста
- Размеры
- 70M – 20B
- Железо
- от: Ноутбук
Текст2022
Meta · США
Ранняя открытая серия Meta, повторяющая по размерам GPT-3. Устарела, полезна для исследований и сравнения.
- Исследовательские эксперименты
- Обучение специалистов
- Сравнение с современными моделями
- Размеры
- 125M – 66B (175B по запросу)
- Железо
- от: Ноутбук
Текст2022
BigScience (Hugging Face и сообщество) · Франция
Одна из первых больших открытых моделей, обученная сообществом из сотен исследователей на 46 языках. Сегодня интересна скорее как историческая веха.
- Генерация и перевод текстов на многих языках
- Эксперименты и обучение команды
- Базовая модель для дообучения под узкую задачу
- Размеры
- 560M – 176B
- Железо
- от: Ноутбук
Обработка фото2021–2022
Tencent ARC Lab · Китай
Классика увеличения фото в 2–4 раза с очисткой от шума и артефактов сжатия. Лёгкая, работает даже на процессоре. Есть версии для рисунков и аниме.
- Увеличение старых и мелких фото товаров
- Очистка картинок от артефактов сжатия
- Подготовка изображений к печати
- Размеры
- около 17M
- Железо
- от: Ноутбук
Обработка фото2021–2022
Tencent ARC Lab · Китай
Проверенная реставрация лиц на старых и сжатых фото с коммерческой лицензией. Часто работает в паре с Real-ESRGAN, самые ходовые версии 1.3 и 1.4.
- Восстановление лиц на старых фото
- Улучшение аватаров и фото профиля
- Реставрация в фотосалоне или онлайн-сервисе
- Размеры
- небольшая, до 0.1B
- Железо
- от: Ноутбук
Разбор текста2019–2022
Meta · США
Классический многоязычный энкодер на 100 языков, включая русский. Основа многих моделей тональности, NER и эмбеддингов, в том числе BGE-M3.
- Определение тональности отзывов на разных языках
- Извлечение имён и организаций после дообучения
- Классификация обращений
- Размеры
- 270M – 10.7B
- Железо
- от: Ноутбук
Разбор текста2021
Microsoft · США
Проверенный временем энкодер, на котором построено множество классификаторов и NER-моделей (в том числе GLiNER). Многоязычная mDeBERTa-v3 понимает русский.
- Классификация отзывов по тональности
- Извлечение сущностей после дообучения
- Проверка, следует ли вывод из текста
- Размеры
- 70M – 435M
- Железо
- от: Ноутбук
Разбор текста2021
Давид Дале (cointegrated) · Россия
Очень маленький русско-английский BERT, работает быстро на обычном процессоре. Есть готовые дообученные версии для тональности, токсичности и эмоций.
- Определение тональности отзывов
- Фильтр грубых сообщений в чате
- Быстрая классификация обращений
- Размеры
- 12M – 29M
- Железо
- от: Ноутбук
Обработка фото2021
Samsung AI Center Москва (вместе со Сколтехом) · Россия
Удаление лишних объектов, надписей и водяных знаков с фото с аккуратной дорисовкой фона. Лёгкая и быстрая, до сих пор стандарт для такой задачи.
- Удаление ценников, людей и мусора с фото
- Чистка фото интерьеров и недвижимости
- Удаление надписей и дат с архивных снимков
- Размеры
- около 51M
- Железо
- от: Ноутбук
Обработка фото2021
ETH Zurich · Швейцария
Модель на трансформере для увеличения, шумоподавления и очистки фото от артефактов JPEG. Лёгкая и проверенная, часто стоит внутри других систем.
- Увеличение фото
- Шумоподавление снимков
- Очистка от артефактов сжатия
- Размеры
- около 12M
- Железо
- от: Ноутбук
Перевод2020–2021
Meta · США
Ранний переводчик Meta, который переводит напрямую между 100 языками, без английского посередине. Русский есть. Старый, но лёгкий и свободный.
- Перевод между любой парой из 100 языков
- Быстрый черновой перевод на слабом железе
- Основа для дообучения под свою тематику
- Размеры
- 418M – 12B
- Железо
- от: Ноутбук