МедицинаGGUF2023–2026
FreedomIntelligence (Китайский университет Гонконга, Шэньчжэнь) · Китай
Большое семейство медицинских моделей: чат, версия со снимками, рассуждающая HuatuoGPT-o1 и новая HuatuoGPT-3 на Qwen3. Не заменяет врача, решения принимает специалист.
- Черновики выписок для проверки врачом
- Поиск по медицинской литературе
- Подсказки при разборе снимков для врача (Vision)
- Размеры
- 7B – 72B
- Железо
- от: Ноутбук
ТекстOllama2023–2026
DeepSeek · Китай
Флагманская линия DeepSeek: от первых 7B/67B до V4-Pro на 1,6 трлн параметров. Уровень закрытых моделей при открытой MIT-лицензии; картинки понимают V4-Flash-Vision-Exp и V4.1-Flash, контекст до 1 млн токенов.
- Ассистент для сотрудников на своём сервере
- Разбор длинных договоров и отчётов
- Агенты, которые работают с инструментами и API
- Размеры
- 7B – 1.6T-A49B
- Железо
- от: Ноутбук
ТекстOllama2023–2026
Shanghai AI Laboratory · Китай
Модели Шанхайской лаборатории ИИ. Ранняя линия InternLM — универсальная, новая Intern-S1/S2 — научная: понимает формулы, молекулы, графики и картинки.
- Помощник исследователя: статьи, формулы, данные
- Разбор научных и технических документов
- Корпоративный чат на малых моделях
- Размеры
- 1.8B – около 1T
- Железо
- от: Ноутбук
ТекстGGUF2025–2026
Xiaomi · Китай
Модели Xiaomi для рассуждений и агентов: от компактной MiMo-7B до MiMo-V2.6-Pro на 1,02 трлн параметров. Старшие версии понимают текст, картинки, видео и звук, контекст — 1 млн токенов. Языки: английский и китайский.
- Логические и расчётные задачи
- Агенты с инструментами
- Помощь программистам
- Размеры
- 7B – 1,02T-A42B
- Железо
- от: Ноутбук
ТекстRUOllama2024–2026
Cohere Labs · Канада
Многоязычные модели исследовательского крыла Cohere, от 23 до 100+ языков. Tiny Aya 2026 года на 3.3B работает на обычном ПК, но только некоммерчески.
- Перевод и переписка на редких языках
- Многоязычный чат-ассистент
- Разбор изображений с текстом (Vision)
- Размеры
- 3.3B – 35B
- Железо
- от: Ноутбук
Документы и OCR2026
Jina AI · Германия
Разбор документов одной моделью: страница целиком превращается в Markdown — текст в правильном порядке чтения, таблицы и формулы в LaTeX. Построена на DeepSeek-OCR, активны только 0,6 млрд параметров из 3,4.
- Перевод сканов и PDF в Markdown
- Распознавание таблиц и формул
- Разбор счетов, актов и отчётов
- Размеры
- 3.4B-A0.6B
- Железо
- от: 1 видеокарта
ТекстRUOllama2023–2026
Alibaba · Китай
Семейство языковых моделей с сильным русским языком: от маленьких версий для ноутбука до флагмана уровня коммерческих API.
- Чат-бот и ассистент по базе знаний
- Ответы на письма и обращения
- Разбор и классификация документов
- Размеры
- 0,6B – 2,4T-A95B
- Железо
- от: Ноутбук
ТекстOllama2023–2026
Zhipu AI (Z.ai) · Китай
Одна из старейших китайских открытых линий: от ChatGLM-6B до GLM-5.3. Сильна в агентных задачах и программировании; GLM-5.3-Flash понимает картинки и выходит под MIT.
- Корпоративный чат-ассистент
- Агенты для рутинных офисных задач
- Помощь программистам
- Размеры
- 1.5B – 744B-A40B
- Железо
- от: Ноутбук
ТекстRUOllama2024–2026
Cohere · Канада
Модели для бизнеса: поиск по документам со ссылками на источники, вызов инструментов, много языков. Command A+ 2026 года впервые вышла под Apache 2.0, за ней — линейка North: код, перевод и компактное зрение.
- Ответы по базе знаний со ссылками на источники
- Агенты, работающие с внутренними системами
- Перевод и переписка на разных языках
- Размеры
- 2.5B – 218B-A25B
- Железо
- от: Ноутбук
ТекстOllama2024–2026
NVIDIA · США
Модели NVIDIA для агентов и рассуждений, заточенные под быстрый запуск на её видеокартах. Nemotron 3 это гибрид Mamba и MoE от 4B до 550B; Nano Omni разбирает видео, аудио и картинки (только английский).
- Агенты с вызовом инструментов
- Задачи с рассуждением и расчётами
- Ответы по длинным документам
- Размеры
- 4B – 550B-A55B
- Железо
- от: Ноутбук
ТекстRUOllama2025–2026
Liquid AI · США
Модели новой архитектуры для работы прямо на устройстве: быстрые на обычном процессоре и в телефоне. Есть версии для извлечения данных, RAG и инструментов, а также LFM2.5-VL для картинок и голосовая LFM2.5-Audio.
- Ассистент на ноутбуке или телефоне без интернета
- Извлечение данных из документов
- Вызов инструментов в приложениях
- Размеры
- 230M – 24B-A2B
- Железо
- от: Ноутбук
ТекстOllama2026
Meta Superintelligence Labs · США
Открытая модель Meta для агентов на доступном железе: дистиллирована из закрытой Muse Spark, понимает текст и картинки, обучена на 100+ языках.
- Агенты с вызовом инструментов
- Разбор скриншотов, графиков и документов
- Многоязычный ассистент
- Размеры
- 30B
- Железо
- от: 1 видеокарта
Агенты для компьютера2025–2026
XLANG Lab (Гонконгский университет) · Китай
Полностью открытые агенты для рабочего стола: веса, данные и код обучения. Работают в Windows, macOS и Linux, свежий Qwen-CUA управляет компьютером обычными кликами и клавишами.
- Работа в настольных программах без API
- Перенос данных между системами
- Прогон пользовательских сценариев для тестов
- Размеры
- 7B – около 400B (MoE)
- Железо
- от: 1 видеокарта
Агенты для компьютераGGUF2025–2026
Ant Group (inclusionAI) · Китай
Семейство Ant Group для поиска элементов на экране и выполнения задач в интерфейсе телефона и компьютера. UI-Venus-2 отдельно обучали отказываться от опасных действий.
- Автоматизация действий в мобильных приложениях
- Заполнение форм в веб-интерфейсах
- Автотесты интерфейсов
- Размеры
- 2B – 72B
- Железо
- от: Ноутбук
Автономное вождение2025–2026
NVIDIA · США
Модели «зрение–язык–действие» для беспилотников: по видео с камер строят траекторию и объясняют решение текстом. Используются для разработки и проверки систем автопилота, а не как готовый автопилот.
- Авторазметка записей с камер для обучения своих систем помощи водителю
- Разбор сложных дорожных сцен с текстовым объяснением
- Проверка систем автопилота в симуляторе на редких сценариях
- Размеры
- 10B – 34B
- Железо
- от: 1 видеокарта
Автономное вождение2026
Alibaba (команда Qwen) · Китай
Модель для автономного вождения на базе Qwen3.5-4B: 3D-распознавание объектов вокруг машины, ответы на вопросы о дорожной сцене и планирование траектории в одной модели.
- Прототип восприятия и планирования для беспилотной техники на закрытой территории
- Ответы на вопросы о записях с камер при разборе инцидентов
- Разметка дорожных сцен для обучения своих моделей
- Размеры
- 4B
- Железо
- от: 1 видеокарта
ТекстRUOllama2023–2026
Mistral AI · Франция
Европейские модели с упором на скорость. Mixtral — одна из первых открытых моделей на архитектуре «смесь экспертов»; есть версии с картинками (Pixtral, Medium 3.5), для доказательств в Lean и модерации (Shieldstral).
- Быстрые ответы в чате
- Извлечение данных из текста
- Перевод и работа с несколькими языками
- Размеры
- 3B – 675B
- Железо
- от: Ноутбук
ТекстGGUF2025–2026
Moonshot AI · Китай
Сверхкрупные MoE-модели Moonshot для агентной работы. K3 на 2,8 трлн параметров — самая большая открытая модель на момент выхода, с контекстом до 1 млн токенов и пониманием картинок; K2.7-Code заточена под программирование.
- Многошаговые агенты: поиск, сбор данных, отчёты
- Глубокий анализ документов
- Помощь программистам
- Размеры
- 16B-A3B – 2.8T-A104B
- Железо
- от: 1 видеокарта
ТекстOllama2024–2026
LG AI Research · Южная Корея
Корейско-английские модели LG. Большая часть линии некоммерческая, но флагман K-EXAONE 2.0 на 750 млрд параметров вышел под Apache 2.0.
- Корпоративный ассистент
- Работа с корейскими и английскими текстами
- Разбор документов и картинок (4.5)
- Размеры
- 1.2B – 750B-A37B
- Железо
- от: Ноутбук
ТекстGGUF2025–2026
Swiss AI (ETH Zurich, EPFL, CSCS) · Швейцария
Государственная открытая модель Швейцарии: открыты веса, данные и рецепт, более 1000 языков в обучении. Версия 1.5 понимает изображения.
- Многоязычный ассистент
- Ответы по документам
- Разбор изображений и сканов (v1.5)
- Размеры
- 0.5B – 70B
- Железо
- от: Ноутбук
ТекстGGUF2026
Thinking Machines Lab · США
Флагманские открытые модели лаборатории Миры Мурати: принимают текст, изображения и аудио. Большие MoE, требуют нескольких видеокарт.
- Корпоративный ассистент уровня флагмана
- Разбор документов, изображений и аудио
- Помощь в программировании
- Размеры
- 276B-A12B, 975B-A41B
- Железо
- от: Кластер
Картинка + текстGGUF2024–2026
Alibaba (AIDC-AI) · Китай
Модели зрения от международного подразделения Alibaba с сильным чтением текста и таблиц. В линейке есть MoE Ovis2.6 и отдельные компактные OvisOCR для документов.
- Извлечение данных из счетов, договоров и накладных
- Распознавание таблиц
- Ответы на вопросы по фото и графикам
- Размеры
- 0.9B – 80B-A3B
- Железо
- от: Ноутбук
Агенты для компьютераGGUF2025–2026
Microsoft · США
Небольшие модели Microsoft для работы в браузере: смотрят на страницу и кликают, печатают, прокручивают. Рассчитаны на запуск прямо на рабочем компьютере без облака.
- Заполнение веб-форм и заявок
- Сбор данных из веб-кабинетов без API
- Проверка сайтов по сценарию
- Размеры
- 4B – 27B
- Железо
- от: Ноутбук
Картинка + текст2026
OpenMOSS (Фуданьский университет) · Китай
Модель «картинка + видео + текст» с упором на длинные видео и точную привязку событий к секундам. Есть версия Realtime для потокового видео в реальном времени.
- Разбор длинных видео и поиск событий по времени
- Потоковый анализ видео в реальном времени
- Понимание фото и документов
- Размеры
- около 11B
- Железо
- от: 1 видеокарта
ТекстOllama2024–2026
Google · США
Компактные модели Google: хорошо работают на одном компьютере, старшие версии понимают картинки. Есть CodeGemma для кода, FunctionGemma 270M для вызова функций и быстрая DiffusionGemma.
- Ассистент на ноутбуке без интернета
- Разбор фото документов и чеков
- Классификация обращений
- Размеры
- 270M – 31B
- Железо
- от: Ноутбук
ТекстRUGGUF2025–2026
MiniMax · Китай
Крупные MoE-модели с очень длинным контекстом (до 1 млн токенов у Text-01 и M3). M3 — мультимодальная, понимает картинки. Лицензии сильно различаются от версии к версии.
- Анализ больших архивов документов за один запрос
- Агенты с инструментами
- Помощь программистам
- Размеры
- 230B-A10B – 456B-A46B
- Железо
- от: Кластер
Картинка + текстOllama2024–2026
Moondream (M87 Labs) · США
Небольшая и быстрая модель зрения для продуктовых задач: ответы на вопросы, поиск и указание объектов, подписи. Moondream 3.1 — MoE на 9B с 2B активных.
- Поиск объектов и подсчёт на фото
- Проверка фото из полевых отчётов
- Подписи и теги для каталога
- Размеры
- 2B – 9B-A2B
- Железо
- от: Ноутбук
Картинка + текст2023–2026
Shanghai AI Lab (OpenGVLab) · Китай
Семейство моделей для видео: энкодеры для поиска и классификации роликов и чат-модели, которые разбирают длинные видео. InternVideo 3 рассчитан на многочасовые записи.
- Поиск по видеоархиву текстовым запросом
- Распознавание действий на видео
- Ответы на вопросы по длинной записи
- Размеры
- малые энкодеры – 9B
- Железо
- от: Ноутбук
ТекстGGUF2025–2026
StepFun · Китай
MoE-модели StepFun, рассчитанные на быструю и дешёвую работу: при 196 млрд параметров Step-3.5/3.7-Flash задействуют около 11 млрд на токен. Есть компактные Step3-VL-10B для картинок и голосовая Step-Audio 2 mini.
- Агенты с высокой нагрузкой
- Разбор документов со схемами и скриншотами
- Помощь программистам
- Размеры
- 8B – 321B
- Железо
- от: 1 видеокарта
Картинка + текстOllama2023–2026
LLaVA / LMMs-Lab (исследователи из США и Китая) · США / Китай
Открытый проект, с которого пошла мода на модели «картинка + текст». Линейка OneVision понимает фото, документы и видео; открыты данные и рецепты обучения.
- Ответы на вопросы по фото и скриншотам
- Описание товаров по фотографии
- Разбор видео по кадрам
- Размеры
- 0.5B – 72B
- Железо
- от: Ноутбук
Картинка + текстOllama2024–2026
OpenBMB (ModelBest и Университет Цинхуа) · Китай
Компактные модели зрения, которые работают даже на телефоне и ноутбуке. Хорошо читают текст на фото, понимают видео; версия 4.6 весит всего 1.3B.
- Распознавание текста на фото прямо на устройстве
- Разбор чеков и документов без отправки в облако
- Описание фото и видео
- Размеры
- 1.3B – 8B
- Железо
- от: Ноутбук
Картинка + текстGGUF2025–2026
Kuaishou · Китай
Модели зрения от Kuaishou с упором на короткие видео. Keye-VL-2.0 (30B, активны 3B) хорошо понимает, что и когда происходит в ролике.
- Разбор и описание коротких видео
- Проверка роликов и контента
- Поиск нужного момента в видео
- Размеры
- 8B – 671B-A37B
- Железо
- от: Ноутбук
Агенты для компьютераGGUF2025–2026
H Company · Франция
Французское семейство моделей для управления браузером и компьютером: точно находит нужный элемент на экране и ведёт многошаговые задачи. Свежие Holo3 и 3.1 открыты под Apache 2.0.
- Работа в веб-кабинетах и старых программах без API
- Заполнение форм и заявок
- Проверка интерфейсов по сценарию
- Размеры
- 0.8B – 235B-A22B
- Железо
- от: Ноутбук
ТекстGGUF2025–2026
Baidu · Китай
Первая открытая линия Baidu: от крошечной 0.3B до MoE на 424 млрд параметров, есть версии с пониманием картинок. Средняя 21B-A3B помещается на одну видеокарту; ERNIE-Image 8B рисует картинки с текстом.
- Корпоративный ассистент
- Разбор документов и изображений
- Классификация обращений
- Размеры
- 0.3B – 424B-A47B
- Железо
- от: Ноутбук
Картинка + текстOllama2025–2026
IBM · США
Компактные модели IBM для корпоративных документов: таблицы, графики, формы, пары «поле — значение». Карточка честно предупреждает, что лучше всего работает с английским.
- Извлечение полей из форм и счетов
- Перевод графиков и таблиц в данные
- Ответы на вопросы по документам
- Размеры
- 2B – 4B
- Железо
- от: Ноутбук
Агенты для компьютера2024–2026
Show Lab (Национальный университет Сингапура) · Сингапур
Лёгкая модель для работы с интерфейсом: находит кнопки и поля по описанию и выполняет действия в вебе и на телефоне. ShowUI-π умеет перетаскивание мышью.
- Клики и заполнение форм по описанию задачи
- Автотесты веб-интерфейсов
- Помощник на слабом компьютере без облака
- Размеры
- 2B (ShowUI), около 500M (ShowUI-π)
- Железо
- от: Ноутбук
ТекстGGUF2025–2026
ServiceNow · США
Модели ServiceNow на 15B с пошаговыми рассуждениями, которые помещаются на одну видеокарту. С версии 1.5 понимают и картинки, хорошо вызывают инструменты.
- Ассистент с рассуждениями для внутренних сервисов
- Вызов инструментов и корпоративные агенты
- Разбор скриншотов и документов с картинками
- Размеры
- 5B – 15B
- Железо
- от: Ноутбук
МедицинаGGUF2025–2026
Чжэцзянский университет · Китай
Медицинская модель для текста, снимков, 3D-исследований и видео: от лёгкой 4B до крупной MoE. Не заменяет врача, решения принимает специалист.
- Подсказки при разборе снимков и КТ для врача
- Черновики заключений и выписок
- Поиск по медицинской литературе
- Размеры
- 4B – 235B-A22B
- Железо
- от: Ноутбук
Текст2025–2026
Reka AI · США
Компактные модели Reka: Flash 3 на 21B для рассуждений и Reka Edge на 7B, которая быстро разбирает изображения и видео на устройстве.
- Разбор фото и видео (Edge)
- Поиск объектов на изображениях
- Задачи с рассуждением (Flash)
- Размеры
- 7B – 21B
- Железо
- от: Ноутбук
Картинка + текстGGUF2023–2026
Shanghai AI Laboratory (OpenGVLab) · Китай
Большая линейка китайских моделей зрения с размерами от 1B до 241B. InternVL-U (4B) объединяет понимание картинок, их генерацию и редактирование.
- Понимание документов, схем и графиков
- Ответы на вопросы по фото
- Разбор видео
- Размеры
- 1B – 241B-A28B
- Железо
- от: Ноутбук
Картинка + текст2024–2026
Ai2 (Allen Institute for AI) · США
Полностью открытые модели зрения Ai2 (веса и данные). Умеют указывать точку на картинке и считать предметы; Molmo2 понимает видео, MolmoWeb управляет браузером.
- Подсчёт товаров и объектов на фото
- Указание, где на снимке нужный предмет
- Разбор видео
- Размеры
- 1B-A7B – 72B
- Железо
- от: Ноутбук
Голосовые ассистентыGGUF2025–2026
OpenBMB (ModelBest, Университет Цинхуа) · Китай
Небольшая модель, которая видит, слышит и отвечает голосом в реальном времени, может клонировать голос. Голосовой диалог на английском и китайском, текст — на 30+ языках.
- Голосовой ассистент на своём сервере
- Разбор видео и документов
- Ответы голосом по картинке с камеры
- Размеры
- 8B – 9B
- Железо
- от: Ноутбук
Агенты для компьютера2025–2026
Alibaba (Tongyi Lab, X-PLUG) · Китай
Модели для управления телефоном и компьютером из проекта Mobile-Agent: работают с Android, Windows, macOS и браузером, в версии 1.5 есть режим с рассуждением.
- Автоматизация действий в мобильных приложениях
- Работа в настольных программах без API
- Тестирование приложений по сценарию
- Размеры
- 2B – 32B
- Железо
- от: Ноутбук
Картинка + текст2026
Sukhrob Nurali · не раскрыта
Дообученная Qwen3-VL-8B читает страницы резюме как картинки и возвращает запись из 23 полей в JSON. Автор прямо пишет: для автоматических решений по кандидатам модель не предназначена, решение принимает человек.
- Перенос резюме из PDF в карточку кандидата
- Заполнение базы кандидатов без ручного ввода
- Разбор резюме с разной вёрсткой и оформлением
- Размеры
- 8B, дообучение Qwen3-VL-8B-Instruct
- Железо
- от: 1 видеокарта
МедицинаOllama2025–2026
Google · США
Медицинская версия Gemma от Google: читает медицинские тексты и снимки (рентген, дерматология, гистология). Инструмент для врача и разработчика, не заменяет врача, решения принимает специалист.
- Черновики выписок и заключений для проверки врачом
- Подсказки при разборе снимков для врача
- Поиск и пересказ медицинской литературы
- Размеры
- 4B – 27B
- Железо
- от: Ноутбук
Медицина2023–2026
Stanford AIMI · США
Стэнфордские модели для рентгена грудной клетки: описывают снимок и готовят черновик заключения. Не заменяет врача, решения принимает специалист.
- Черновик описания рентгенограммы для врача-рентгенолога
- Подсказки при разборе снимков для врача
- Проверка полноты заключений
- Размеры
- 3B – 8B
- Железо
- от: Ноутбук
МедицинаGGUF2025–2026
Alibaba DAMO Academy · Китай
Медицинская модель Alibaba на основе Qwen2.5-VL: понимает снимки разных типов и медицинский текст, умеет рассуждать по шагам. Не заменяет врача, решения принимает специалист.
- Подсказки при разборе снимков для врача
- Черновики заключений и выписок
- Поиск по медицинской литературе
- Размеры
- 7B – 32B
- Железо
- от: Ноутбук
ТекстRUOllama2023–2026
Microsoft · США
Малые модели Microsoft, обученные на тщательно отобранных данных: сильны в логике и математике при скромном размере. Есть версии с картинками и речью.
- Ассистент на ноутбуке или своём сервере
- Задачи с рассуждением и расчётами
- Разбор изображений и схем (vision-версии)
- Размеры
- 1.3B – 42B-A6.6B
- Железо
- от: Ноутбук
Агенты для компьютераGGUF2026
Meituan · Китай
Агент Meituan для управления компьютером, обученный на большом числе смоделированных задач в настольных программах. На выходе даёт клики и ввод с клавиатуры.
- Работа в офисных и старых программах без API
- Перенос данных между системами
- Прогон сценариев для тестов
- Размеры
- 8B – 32B
- Железо
- от: 1 видеокарта
Текст2025
Naver · Южная Корея
Открытые младшие модели корейского Naver: от 0.5B до 32B, включая рассуждающие Think и мультимодальные версии с пониманием картинок.
- Лёгкий корейско-английский ассистент
- Разбор картинок и документов
- Классификация текстов
- Размеры
- 0.5B – 32B
- Железо
- от: Ноутбук
Картинка + текст2023–2025
Zhipu AI (Z.ai) и Университет Цинхуа · Китай
Модели зрения от Zhipu: сначала CogVLM, затем линейка GLM-V. GLM-4.6V умеет вызывать инструменты по картинкам и работать как агент с интерфейсом.
- Ответы на вопросы по фото и документам
- Агент, работающий с интерфейсом по скриншотам
- Разбор графиков и отчётов
- Размеры
- 9B – 106B-A12B
- Железо
- от: Ноутбук
Агенты для компьютера2023–2025
Zhipu AI (Z.ai) и Университет Цинхуа · Китай
Одна из первых открытых моделей для управления интерфейсом по скриншоту, развитие — AutoGLM-Phone для работы в приложениях смартфона на Android.
- Автоматизация действий в мобильных приложениях
- Работа в веб-интерфейсах без API
- Тестирование приложений по сценарию
- Размеры
- 9B – 18B
- Железо
- от: 1 видеокарта
Агенты для компьютераGGUF2025
Alibaba (Tongyi-MAI) · Китай
Компактные модели Alibaba для работы в интерфейсе смартфона и компьютера: находят элементы и выполняют многошаговые задачи. Малый размер позволяет запуск на обычной видеокарте.
- Автоматизация действий в мобильных приложениях
- Работа в программах без API
- Автотесты интерфейсов
- Размеры
- 2B – 8B
- Железо
- от: Ноутбук
Картинка + текстOllama2023–2025
Alibaba (команда Qwen) · Китай
Одна из сильнейших открытых моделей зрения: читает документы, таблицы, графики, видео, работает с интерфейсами. С Qwen3.5 зрение встроено прямо в основную модель Qwen.
- Извлечение данных из сканов счетов и накладных
- Разбор фотографий товаров и витрин
- Анализ видео и записей с камер
- Размеры
- 2B – 235B-A22B
- Железо
- от: Ноутбук
Картинка + текстRU2025
Авито Тех · Россия
Русскоязычная модель Авито, которая понимает картинки: описывает фото, отвечает на вопросы по изображению, читает надписи. Основа Qwen2.5-VL, на русском быстрее исходной.
- Описание товара по фото на русском
- Проверка, что фото совпадает с описанием
- Чтение брендов и надписей на картинках
- Размеры
- 7.4B
- Железо
- от: 1 видеокарта
Голосовые ассистентыRUGGUF2025
Alibaba (Qwen) · Китай
Модели, которые понимают текст, картинки, аудио и видео и отвечают голосом в реальном времени. Qwen3-Omni говорит на 10 языках, включая русский.
- Голосовой ассистент для клиентов
- Разбор звонков и видео
- Ответы голосом по документам и картинкам
- Размеры
- 3B – 30B-A3B
- Железо
- от: Ноутбук
Картинка + текстGGUF2025
Moonshot AI · Китай
Экономичная MoE-модель зрения (16B, активны 3B) с длинным контекстом и рассуждающей версией. Хорошо разбирает длинные документы и видео.
- Разбор длинных PDF и презентаций
- Ответы на вопросы по видео
- Работа с интерфейсами по скриншотам
- Размеры
- 16B-A3B
- Железо
- от: 1 видеокарта
КартинкиGGUF2025
ByteDance Seed · Китай
Единая модель, которая и понимает картинки, и генерирует, и редактирует их по диалогу. Похожа на то, как работают картинки в ChatGPT.
- Редактирование фото в диалоге
- Ответы на вопросы по изображению
- Генерация картинок с пояснениями
- Размеры
- 14B-A7B
- Железо
- от: 1 видеокарта
ТекстOllama2023–2025
Meta · США
Модели, с которых начался массовый open source в ИИ. Огромная экосистема дообученных версий и инструментов.
- Ассистент для сотрудников
- Суммаризация встреч и документов
- Основа для дообучения под отрасль
- Размеры
- 1B – 405B
- Железо
- от: Ноутбук
Картинка + текстGGUF2024–2025
Hugging Face · Франция / США
Самые маленькие модели зрения Hugging Face: от 256M, работают в браузере и на телефоне. SmolVLM2 понимает и видео.
- Описание фото и видео на слабом железе
- Чтение простых документов
- Встраивание в мобильные и офлайн-приложения
- Размеры
- 256M – 2.2B
- Железо
- от: Ноутбук
Агенты для компьютераGGUF2025
ByteDance Seed · Китай
Модель, которая смотрит на скриншот и сама двигает мышью и клавиатурой: кликает, заполняет поля, переходит по меню. Открыты 1-е поколение и 1.5-7B; UI-TARS-2 весов не открыл.
- Работа в старых программах без API
- Заполнение форм и перенос данных между системами
- Автотесты интерфейсов по сценарию на обычном языке
- Размеры
- 2B – 72B
- Железо
- от: Ноутбук
Агенты для компьютераGGUF2025
Microsoft Research · США
Модель-агент, которая одинаково планирует действия и в интерфейсе (кнопки на экране), и для робота (движения манипулятора). Пока скорее исследовательская база, чем готовый продукт.
- Пилоты по управлению интерфейсом
- Исследовательские проекты на стыке экрана и робототехники
- Разбор скриншотов с планом действий
- Размеры
- 8B
- Железо
- от: 1 видеокарта
Картинка + текстGGUF2024–2025
DeepSeek · Китай
Одна модель и понимает картинки, и рисует их по описанию. Janus-Pro-7B была заметна в начале 2025 года, но по качеству картинок уступает специализированным моделям.
- Ответы на вопросы по картинкам
- Черновые иллюстрации по описанию
- Эксперименты с единой моделью зрения и генерации
- Размеры
- 1B – 7B
- Железо
- от: Ноутбук
Картинка + текст2023–2025
Alibaba DAMO Academy · Китай
Модели, которые смотрят видео и отвечают на вопросы о нём: что происходит, в какой момент, кто что делает. VideoLLaMA 3 на 2B и 7B — одни из сильнейших в своём размере.
- Описание и краткий пересказ видео
- Поиск момента в записи по вопросу
- Разметка видеоархива
- Размеры
- 2B – 72B
- Железо
- от: Ноутбук
Картинка + текстGGUF2024
Google · США
Модель зрения Google на базе Gemma, задуманная как основа для дообучения под узкую задачу: подписи, поиск объектов, чтение текста.
- Дообучение под свою задачу распознавания
- Поиск объектов на фото
- Чтение текста на изображениях
- Размеры
- 3B – 28B
- Железо
- от: Ноутбук
Картинка + текстНе развивается2023–2024
Hugging Face · Франция / США
Открытые модели зрения от Hugging Face, воспроизводившие закрытую Flamingo. Idefics3 стала основой для компактной линейки SmolVLM.
- Ответы на вопросы по картинкам
- Разбор документов и скриншотов
- Основа для дообучения
- Размеры
- 8B – 80B
- Железо
- от: 1 видеокарта
Документы и OCRНе развивается2024
Microsoft · США
Превращает скан страницы в размеченный текст с координатами блоков или в markdown. Удобна как первый шаг перед разбором резюме. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.
- Перевод сканов резюме в текст с сохранением структуры
- Подготовка документов к извлечению полей
- Оцифровка бумажных анкет
- Размеры
- около 1.4B
- Железо
- от: 1 видеокарта
Картинка + текстНе развивается2024
Microsoft · США
Очень маленькая модель зрения: подписи, поиск объектов, сегментация и чтение текста по одной команде. Работает даже на процессоре.
- Чтение текста на фото
- Поиск и выделение объектов
- Автоматические подписи к фото
- Размеры
- 0.23B – 0.77B
- Железо
- от: Ноутбук
Документы и OCRНе развивается2024
Microsoft · США
Одна модель на все задачи с документом: чтение, ответы на вопросы по странице, извлечение полей, классификация. В HR применяется для разбора резюме и приложенных сканов. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.
- Извлечение полей из резюме и приложений к нему
- Ответы на вопросы по содержимому документа
- Классификация входящих документов
- Размеры
- 742M
- Железо
- от: Ноутбук
МедицинаНе развивается2023
Шанхайский университет Цзяо Тун и Shanghai AI Lab · Китай
Ранняя общая модель для радиологии: понимает 2D- и 3D-снимки (КТ, МРТ) вместе с текстом. Скорее исследовательская база. Не заменяет врача, решения принимает специалист.
- Исследовательские пилоты по разбору КТ и МРТ
- Подсказки при разборе снимков для врача
- Основа для своего дообучения на снимках клиники
- Размеры
- размер на карточке не указан
- Железо
- от: 1 видеокарта
Картинка + текстНе развивается2023
Google · США
Читает документ или скриншот как картинку и отвечает структурой: текст, поля, ответы на вопросы. В HR её дообучают под резюме и анкеты. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.
- Извлечение данных из резюме и анкет в виде картинок
- Вопросы к содержимому скана
- Разбор таблиц и схем в документах
- Размеры
- 282M – 1.3B
- Железо
- от: Ноутбук
Документы и OCRНе развивается2022
NAVER CLOVA · Южная Корея
Читает скан документа и сразу отдаёт заполненную структуру полей, без отдельного OCR. В HR её дообучают под разбор резюме и анкет. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.
- Извлечение полей из анкет и резюме
- Разбор сканов справок и дипломов
- Определение типа входящего документа
- Размеры
- около 200M
- Железо
- от: Ноутбук