Мультимодальные модели: картинка и текст

Такие модели смотрят на изображение и отвечают на вопросы о нём: описывают товар на фото, разбирают скриншот, график или схему, находят детали на снимке. Это основа для проверки фотоотчётов, карточек товаров и визуальной поддержки. При выборе проверьте качество ответов на русском, лицензию и объём видеопамяти.

В подборке 72 семейства открытых моделей.Обновлено 22.09.2026Открыть весь каталог с фильтрами
МедицинаGGUF2023–2026

HuatuoGPT

FreedomIntelligence (Китайский университет Гонконга, Шэньчжэнь) · Китай

Большое семейство медицинских моделей: чат, версия со снимками, рассуждающая HuatuoGPT-o1 и новая HuatuoGPT-3 на Qwen3. Не заменяет врача, решения принимает специалист.

  • Черновики выписок для проверки врачом
  • Поиск по медицинской литературе
  • Подсказки при разборе снимков для врача (Vision)
Размеры
7B – 72B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ТекстOllama2023–2026

DeepSeek

DeepSeek · Китай

Флагманская линия DeepSeek: от первых 7B/67B до V4-Pro на 1,6 трлн параметров. Уровень закрытых моделей при открытой MIT-лицензии; картинки понимают V4-Flash-Vision-Exp и V4.1-Flash, контекст до 1 млн токенов.

  • Ассистент для сотрудников на своём сервере
  • Разбор длинных договоров и отчётов
  • Агенты, которые работают с инструментами и API
Размеры
7B – 1.6T-A49B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ТекстOllama2023–2026

InternLM / Intern-S

Shanghai AI Laboratory · Китай

Модели Шанхайской лаборатории ИИ. Ранняя линия InternLM — универсальная, новая Intern-S1/S2 — научная: понимает формулы, молекулы, графики и картинки.

  • Помощник исследователя: статьи, формулы, данные
  • Разбор научных и технических документов
  • Корпоративный чат на малых моделях
Размеры
1.8B – около 1T
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ТекстGGUF2025–2026

MiMo

Xiaomi · Китай

Модели Xiaomi для рассуждений и агентов: от компактной MiMo-7B до MiMo-V2.6-Pro на 1,02 трлн параметров. Старшие версии понимают текст, картинки, видео и звук, контекст — 1 млн токенов. Языки: английский и китайский.

  • Логические и расчётные задачи
  • Агенты с инструментами
  • Помощь программистам
Размеры
7B – 1,02T-A42B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ТекстRUOllama2024–2026

Aya

Cohere Labs · Канада

Многоязычные модели исследовательского крыла Cohere, от 23 до 100+ языков. Tiny Aya 2026 года на 3.3B работает на обычном ПК, но только некоммерчески.

  • Перевод и переписка на редких языках
  • Многоязычный чат-ассистент
  • Разбор изображений с текстом (Vision)
Размеры
3.3B – 35B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Документы и OCR2026

jina-ocr-v1

Jina AI · Германия

Разбор документов одной моделью: страница целиком превращается в Markdown — текст в правильном порядке чтения, таблицы и формулы в LaTeX. Построена на DeepSeek-OCR, активны только 0,6 млрд параметров из 3,4.

  • Перевод сканов и PDF в Markdown
  • Распознавание таблиц и формул
  • Разбор счетов, актов и отчётов
Размеры
3.4B-A0.6B
Железо
от: 1 видеокарта
Только некоммерческоеПодробнее
ТекстRUOllama2023–2026

Qwen

Alibaba · Китай

Семейство языковых моделей с сильным русским языком: от маленьких версий для ноутбука до флагмана уровня коммерческих API.

  • Чат-бот и ассистент по базе знаний
  • Ответы на письма и обращения
  • Разбор и классификация документов
Размеры
0,6B – 2,4T-A95B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
ТекстOllama2023–2026

GLM (ChatGLM)

Zhipu AI (Z.ai) · Китай

Одна из старейших китайских открытых линий: от ChatGLM-6B до GLM-5.3. Сильна в агентных задачах и программировании; GLM-5.3-Flash понимает картинки и выходит под MIT.

  • Корпоративный чат-ассистент
  • Агенты для рутинных офисных задач
  • Помощь программистам
Размеры
1.5B – 744B-A40B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
ТекстRUOllama2024–2026

Cohere Command

Cohere · Канада

Модели для бизнеса: поиск по документам со ссылками на источники, вызов инструментов, много языков. Command A+ 2026 года впервые вышла под Apache 2.0, за ней — линейка North: код, перевод и компактное зрение.

  • Ответы по базе знаний со ссылками на источники
  • Агенты, работающие с внутренними системами
  • Перевод и переписка на разных языках
Размеры
2.5B – 218B-A25B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
ТекстOllama2024–2026

NVIDIA Nemotron

NVIDIA · США

Модели NVIDIA для агентов и рассуждений, заточенные под быстрый запуск на её видеокартах. Nemotron 3 это гибрид Mamba и MoE от 4B до 550B; Nano Omni разбирает видео, аудио и картинки (только английский).

  • Агенты с вызовом инструментов
  • Задачи с рассуждением и расчётами
  • Ответы по длинным документам
Размеры
4B – 550B-A55B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
ТекстRUOllama2025–2026

Liquid LFM

Liquid AI · США

Модели новой архитектуры для работы прямо на устройстве: быстрые на обычном процессоре и в телефоне. Есть версии для извлечения данных, RAG и инструментов, а также LFM2.5-VL для картинок и голосовая LFM2.5-Audio.

  • Ассистент на ноутбуке или телефоне без интернета
  • Извлечение данных из документов
  • Вызов инструментов в приложениях
Размеры
230M – 24B-A2B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
ТекстOllama2026

Muse Glimmer

Meta Superintelligence Labs · США

Открытая модель Meta для агентов на доступном железе: дистиллирована из закрытой Muse Spark, понимает текст и картинки, обучена на 100+ языках.

  • Агенты с вызовом инструментов
  • Разбор скриншотов, графиков и документов
  • Многоязычный ассистент
Размеры
30B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Агенты для компьютера2025–2026

OpenCUA / Qwen-CUA

XLANG Lab (Гонконгский университет) · Китай

Полностью открытые агенты для рабочего стола: веса, данные и код обучения. Работают в Windows, macOS и Linux, свежий Qwen-CUA управляет компьютером обычными кликами и клавишами.

  • Работа в настольных программах без API
  • Перенос данных между системами
  • Прогон пользовательских сценариев для тестов
Размеры
7B – около 400B (MoE)
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Агенты для компьютераGGUF2025–2026

UI-Venus

Ant Group (inclusionAI) · Китай

Семейство Ant Group для поиска элементов на экране и выполнения задач в интерфейсе телефона и компьютера. UI-Venus-2 отдельно обучали отказываться от опасных действий.

  • Автоматизация действий в мобильных приложениях
  • Заполнение форм в веб-интерфейсах
  • Автотесты интерфейсов
Размеры
2B – 72B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Автономное вождение2025–2026

NVIDIA Alpamayo

NVIDIA · США

Модели «зрение–язык–действие» для беспилотников: по видео с камер строят траекторию и объясняют решение текстом. Используются для разработки и проверки систем автопилота, а не как готовый автопилот.

  • Авторазметка записей с камер для обучения своих систем помощи водителю
  • Разбор сложных дорожных сцен с текстовым объяснением
  • Проверка систем автопилота в симуляторе на редких сценариях
Размеры
10B – 34B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Автономное вождение2026

Qwen-Drive

Alibaba (команда Qwen) · Китай

Модель для автономного вождения на базе Qwen3.5-4B: 3D-распознавание объектов вокруг машины, ответы на вопросы о дорожной сцене и планирование траектории в одной модели.

  • Прототип восприятия и планирования для беспилотной техники на закрытой территории
  • Ответы на вопросы о записях с камер при разборе инцидентов
  • Разметка дорожных сцен для обучения своих моделей
Размеры
4B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
ТекстRUOllama2023–2026

Mistral

Mistral AI · Франция

Европейские модели с упором на скорость. Mixtral — одна из первых открытых моделей на архитектуре «смесь экспертов»; есть версии с картинками (Pixtral, Medium 3.5), для доказательств в Lean и модерации (Shieldstral).

  • Быстрые ответы в чате
  • Извлечение данных из текста
  • Перевод и работа с несколькими языками
Размеры
3B – 675B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
ТекстGGUF2025–2026

Kimi

Moonshot AI · Китай

Сверхкрупные MoE-модели Moonshot для агентной работы. K3 на 2,8 трлн параметров — самая большая открытая модель на момент выхода, с контекстом до 1 млн токенов и пониманием картинок; K2.7-Code заточена под программирование.

  • Многошаговые агенты: поиск, сбор данных, отчёты
  • Глубокий анализ документов
  • Помощь программистам
Размеры
16B-A3B – 2.8T-A104B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
ТекстOllama2024–2026

EXAONE

LG AI Research · Южная Корея

Корейско-английские модели LG. Большая часть линии некоммерческая, но флагман K-EXAONE 2.0 на 750 млрд параметров вышел под Apache 2.0.

  • Корпоративный ассистент
  • Работа с корейскими и английскими текстами
  • Разбор документов и картинок (4.5)
Размеры
1.2B – 750B-A37B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
ТекстGGUF2025–2026

Apertus

Swiss AI (ETH Zurich, EPFL, CSCS) · Швейцария

Государственная открытая модель Швейцарии: открыты веса, данные и рецепт, более 1000 языков в обучении. Версия 1.5 понимает изображения.

  • Многоязычный ассистент
  • Ответы по документам
  • Разбор изображений и сканов (v1.5)
Размеры
0.5B – 70B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ТекстGGUF2026

Inkling

Thinking Machines Lab · США

Флагманские открытые модели лаборатории Миры Мурати: принимают текст, изображения и аудио. Большие MoE, требуют нескольких видеокарт.

  • Корпоративный ассистент уровня флагмана
  • Разбор документов, изображений и аудио
  • Помощь в программировании
Размеры
276B-A12B, 975B-A41B
Железо
от: Кластер
Можно в коммерциюПодробнее
Картинка + текстGGUF2024–2026

Ovis

Alibaba (AIDC-AI) · Китай

Модели зрения от международного подразделения Alibaba с сильным чтением текста и таблиц. В линейке есть MoE Ovis2.6 и отдельные компактные OvisOCR для документов.

  • Извлечение данных из счетов, договоров и накладных
  • Распознавание таблиц
  • Ответы на вопросы по фото и графикам
Размеры
0.9B – 80B-A3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Агенты для компьютераGGUF2025–2026

Fara

Microsoft · США

Небольшие модели Microsoft для работы в браузере: смотрят на страницу и кликают, печатают, прокручивают. Рассчитаны на запуск прямо на рабочем компьютере без облака.

  • Заполнение веб-форм и заявок
  • Сбор данных из веб-кабинетов без API
  • Проверка сайтов по сценарию
Размеры
4B – 27B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текст2026

MOSS-VL

OpenMOSS (Фуданьский университет) · Китай

Модель «картинка + видео + текст» с упором на длинные видео и точную привязку событий к секундам. Есть версия Realtime для потокового видео в реальном времени.

  • Разбор длинных видео и поиск событий по времени
  • Потоковый анализ видео в реальном времени
  • Понимание фото и документов
Размеры
около 11B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
ТекстOllama2024–2026

Gemma

Google · США

Компактные модели Google: хорошо работают на одном компьютере, старшие версии понимают картинки. Есть CodeGemma для кода, FunctionGemma 270M для вызова функций и быстрая DiffusionGemma.

  • Ассистент на ноутбуке без интернета
  • Разбор фото документов и чеков
  • Классификация обращений
Размеры
270M – 31B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ТекстRUGGUF2025–2026

MiniMax

MiniMax · Китай

Крупные MoE-модели с очень длинным контекстом (до 1 млн токенов у Text-01 и M3). M3 — мультимодальная, понимает картинки. Лицензии сильно различаются от версии к версии.

  • Анализ больших архивов документов за один запрос
  • Агенты с инструментами
  • Помощь программистам
Размеры
230B-A10B – 456B-A46B
Железо
от: Кластер
Коммерция с условиямиПодробнее
Картинка + текстOllama2024–2026

Moondream

Moondream (M87 Labs) · США

Небольшая и быстрая модель зрения для продуктовых задач: ответы на вопросы, поиск и указание объектов, подписи. Moondream 3.1 — MoE на 9B с 2B активных.

  • Поиск объектов и подсчёт на фото
  • Проверка фото из полевых отчётов
  • Подписи и теги для каталога
Размеры
2B – 9B-A2B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Картинка + текст2023–2026

InternVideo

Shanghai AI Lab (OpenGVLab) · Китай

Семейство моделей для видео: энкодеры для поиска и классификации роликов и чат-модели, которые разбирают длинные видео. InternVideo 3 рассчитан на многочасовые записи.

  • Поиск по видеоархиву текстовым запросом
  • Распознавание действий на видео
  • Ответы на вопросы по длинной записи
Размеры
малые энкодеры – 9B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ТекстGGUF2025–2026

Step

StepFun · Китай

MoE-модели StepFun, рассчитанные на быструю и дешёвую работу: при 196 млрд параметров Step-3.5/3.7-Flash задействуют около 11 млрд на токен. Есть компактные Step3-VL-10B для картинок и голосовая Step-Audio 2 mini.

  • Агенты с высокой нагрузкой
  • Разбор документов со схемами и скриншотами
  • Помощь программистам
Размеры
8B – 321B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Картинка + текстOllama2023–2026

LLaVA

LLaVA / LMMs-Lab (исследователи из США и Китая) · США / Китай

Открытый проект, с которого пошла мода на модели «картинка + текст». Линейка OneVision понимает фото, документы и видео; открыты данные и рецепты обучения.

  • Ответы на вопросы по фото и скриншотам
  • Описание товаров по фотографии
  • Разбор видео по кадрам
Размеры
0.5B – 72B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текстOllama2024–2026

MiniCPM-V

OpenBMB (ModelBest и Университет Цинхуа) · Китай

Компактные модели зрения, которые работают даже на телефоне и ноутбуке. Хорошо читают текст на фото, понимают видео; версия 4.6 весит всего 1.3B.

  • Распознавание текста на фото прямо на устройстве
  • Разбор чеков и документов без отправки в облако
  • Описание фото и видео
Размеры
1.3B – 8B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текстGGUF2025–2026

Keye-VL

Kuaishou · Китай

Модели зрения от Kuaishou с упором на короткие видео. Keye-VL-2.0 (30B, активны 3B) хорошо понимает, что и когда происходит в ролике.

  • Разбор и описание коротких видео
  • Проверка роликов и контента
  • Поиск нужного момента в видео
Размеры
8B – 671B-A37B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Агенты для компьютераGGUF2025–2026

Holo

H Company · Франция

Французское семейство моделей для управления браузером и компьютером: точно находит нужный элемент на экране и ведёт многошаговые задачи. Свежие Holo3 и 3.1 открыты под Apache 2.0.

  • Работа в веб-кабинетах и старых программах без API
  • Заполнение форм и заявок
  • Проверка интерфейсов по сценарию
Размеры
0.8B – 235B-A22B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
ТекстGGUF2025–2026

ERNIE 4.5

Baidu · Китай

Первая открытая линия Baidu: от крошечной 0.3B до MoE на 424 млрд параметров, есть версии с пониманием картинок. Средняя 21B-A3B помещается на одну видеокарту; ERNIE-Image 8B рисует картинки с текстом.

  • Корпоративный ассистент
  • Разбор документов и изображений
  • Классификация обращений
Размеры
0.3B – 424B-A47B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текстOllama2025–2026

Granite Vision

IBM · США

Компактные модели IBM для корпоративных документов: таблицы, графики, формы, пары «поле — значение». Карточка честно предупреждает, что лучше всего работает с английским.

  • Извлечение полей из форм и счетов
  • Перевод графиков и таблиц в данные
  • Ответы на вопросы по документам
Размеры
2B – 4B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Агенты для компьютера2024–2026

ShowUI

Show Lab (Национальный университет Сингапура) · Сингапур

Лёгкая модель для работы с интерфейсом: находит кнопки и поля по описанию и выполняет действия в вебе и на телефоне. ShowUI-π умеет перетаскивание мышью.

  • Клики и заполнение форм по описанию задачи
  • Автотесты веб-интерфейсов
  • Помощник на слабом компьютере без облака
Размеры
2B (ShowUI), около 500M (ShowUI-π)
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
ТекстGGUF2025–2026

Apriel

ServiceNow · США

Модели ServiceNow на 15B с пошаговыми рассуждениями, которые помещаются на одну видеокарту. С версии 1.5 понимают и картинки, хорошо вызывают инструменты.

  • Ассистент с рассуждениями для внутренних сервисов
  • Вызов инструментов и корпоративные агенты
  • Разбор скриншотов и документов с картинками
Размеры
5B – 15B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
МедицинаGGUF2025–2026

Hulu-Med

Чжэцзянский университет · Китай

Медицинская модель для текста, снимков, 3D-исследований и видео: от лёгкой 4B до крупной MoE. Не заменяет врача, решения принимает специалист.

  • Подсказки при разборе снимков и КТ для врача
  • Черновики заключений и выписок
  • Поиск по медицинской литературе
Размеры
4B – 235B-A22B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Текст2025–2026

Reka Flash и Reka Edge

Reka AI · США

Компактные модели Reka: Flash 3 на 21B для рассуждений и Reka Edge на 7B, которая быстро разбирает изображения и видео на устройстве.

  • Разбор фото и видео (Edge)
  • Поиск объектов на изображениях
  • Задачи с рассуждением (Flash)
Размеры
7B – 21B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Картинка + текстGGUF2023–2026

InternVL

Shanghai AI Laboratory (OpenGVLab) · Китай

Большая линейка китайских моделей зрения с размерами от 1B до 241B. InternVL-U (4B) объединяет понимание картинок, их генерацию и редактирование.

  • Понимание документов, схем и графиков
  • Ответы на вопросы по фото
  • Разбор видео
Размеры
1B – 241B-A28B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текст2024–2026

Molmo

Ai2 (Allen Institute for AI) · США

Полностью открытые модели зрения Ai2 (веса и данные). Умеют указывать точку на картинке и считать предметы; Molmo2 понимает видео, MolmoWeb управляет браузером.

  • Подсчёт товаров и объектов на фото
  • Указание, где на снимке нужный предмет
  • Разбор видео
Размеры
1B-A7B – 72B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Голосовые ассистентыGGUF2025–2026

MiniCPM-o

OpenBMB (ModelBest, Университет Цинхуа) · Китай

Небольшая модель, которая видит, слышит и отвечает голосом в реальном времени, может клонировать голос. Голосовой диалог на английском и китайском, текст — на 30+ языках.

  • Голосовой ассистент на своём сервере
  • Разбор видео и документов
  • Ответы голосом по картинке с камеры
Размеры
8B – 9B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Агенты для компьютера2025–2026

GUI-Owl / Mobile-Agent

Alibaba (Tongyi Lab, X-PLUG) · Китай

Модели для управления телефоном и компьютером из проекта Mobile-Agent: работают с Android, Windows, macOS и браузером, в версии 1.5 есть режим с рассуждением.

  • Автоматизация действий в мобильных приложениях
  • Работа в настольных программах без API
  • Тестирование приложений по сценарию
Размеры
2B – 32B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текст2026

Qwen3-VL Resume Parser

Sukhrob Nurali · не раскрыта

Дообученная Qwen3-VL-8B читает страницы резюме как картинки и возвращает запись из 23 полей в JSON. Автор прямо пишет: для автоматических решений по кандидатам модель не предназначена, решение принимает человек.

  • Перенос резюме из PDF в карточку кандидата
  • Заполнение базы кандидатов без ручного ввода
  • Разбор резюме с разной вёрсткой и оформлением
Размеры
8B, дообучение Qwen3-VL-8B-Instruct
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
МедицинаOllama2025–2026

MedGemma

Google · США

Медицинская версия Gemma от Google: читает медицинские тексты и снимки (рентген, дерматология, гистология). Инструмент для врача и разработчика, не заменяет врача, решения принимает специалист.

  • Черновики выписок и заключений для проверки врачом
  • Подсказки при разборе снимков для врача
  • Поиск и пересказ медицинской литературы
Размеры
4B – 27B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Медицина2023–2026

CheXagent / CheXOne

Stanford AIMI · США

Стэнфордские модели для рентгена грудной клетки: описывают снимок и готовят черновик заключения. Не заменяет врача, решения принимает специалист.

  • Черновик описания рентгенограммы для врача-рентгенолога
  • Подсказки при разборе снимков для врача
  • Проверка полноты заключений
Размеры
3B – 8B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
МедицинаGGUF2025–2026

Lingshu

Alibaba DAMO Academy · Китай

Медицинская модель Alibaba на основе Qwen2.5-VL: понимает снимки разных типов и медицинский текст, умеет рассуждать по шагам. Не заменяет врача, решения принимает специалист.

  • Подсказки при разборе снимков для врача
  • Черновики заключений и выписок
  • Поиск по медицинской литературе
Размеры
7B – 32B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ТекстRUOllama2023–2026

Phi

Microsoft · США

Малые модели Microsoft, обученные на тщательно отобранных данных: сильны в логике и математике при скромном размере. Есть версии с картинками и речью.

  • Ассистент на ноутбуке или своём сервере
  • Задачи с рассуждением и расчётами
  • Разбор изображений и схем (vision-версии)
Размеры
1.3B – 42B-A6.6B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Агенты для компьютераGGUF2026

EvoCUA

Meituan · Китай

Агент Meituan для управления компьютером, обученный на большом числе смоделированных задач в настольных программах. На выходе даёт клики и ввод с клавиатуры.

  • Работа в офисных и старых программах без API
  • Перенос данных между системами
  • Прогон сценариев для тестов
Размеры
8B – 32B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Текст2025

HyperCLOVA X SEED

Naver · Южная Корея

Открытые младшие модели корейского Naver: от 0.5B до 32B, включая рассуждающие Think и мультимодальные версии с пониманием картинок.

  • Лёгкий корейско-английский ассистент
  • Разбор картинок и документов
  • Классификация текстов
Размеры
0.5B – 32B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Картинка + текст2023–2025

CogVLM и GLM-V

Zhipu AI (Z.ai) и Университет Цинхуа · Китай

Модели зрения от Zhipu: сначала CogVLM, затем линейка GLM-V. GLM-4.6V умеет вызывать инструменты по картинкам и работать как агент с интерфейсом.

  • Ответы на вопросы по фото и документам
  • Агент, работающий с интерфейсом по скриншотам
  • Разбор графиков и отчётов
Размеры
9B – 106B-A12B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Агенты для компьютера2023–2025

CogAgent / AutoGLM

Zhipu AI (Z.ai) и Университет Цинхуа · Китай

Одна из первых открытых моделей для управления интерфейсом по скриншоту, развитие — AutoGLM-Phone для работы в приложениях смартфона на Android.

  • Автоматизация действий в мобильных приложениях
  • Работа в веб-интерфейсах без API
  • Тестирование приложений по сценарию
Размеры
9B – 18B
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Агенты для компьютераGGUF2025

MAI-UI

Alibaba (Tongyi-MAI) · Китай

Компактные модели Alibaba для работы в интерфейсе смартфона и компьютера: находят элементы и выполняют многошаговые задачи. Малый размер позволяет запуск на обычной видеокарте.

  • Автоматизация действий в мобильных приложениях
  • Работа в программах без API
  • Автотесты интерфейсов
Размеры
2B – 8B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текстOllama2023–2025

Qwen-VL

Alibaba (команда Qwen) · Китай

Одна из сильнейших открытых моделей зрения: читает документы, таблицы, графики, видео, работает с интерфейсами. С Qwen3.5 зрение встроено прямо в основную модель Qwen.

  • Извлечение данных из сканов счетов и накладных
  • Разбор фотографий товаров и витрин
  • Анализ видео и записей с камер
Размеры
2B – 235B-A22B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текстRU2025

A-Vision (Авито)

Авито Тех · Россия

Русскоязычная модель Авито, которая понимает картинки: описывает фото, отвечает на вопросы по изображению, читает надписи. Основа Qwen2.5-VL, на русском быстрее исходной.

  • Описание товара по фото на русском
  • Проверка, что фото совпадает с описанием
  • Чтение брендов и надписей на картинках
Размеры
7.4B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Голосовые ассистентыRUGGUF2025

Qwen Omni

Alibaba (Qwen) · Китай

Модели, которые понимают текст, картинки, аудио и видео и отвечают голосом в реальном времени. Qwen3-Omni говорит на 10 языках, включая русский.

  • Голосовой ассистент для клиентов
  • Разбор звонков и видео
  • Ответы голосом по документам и картинкам
Размеры
3B – 30B-A3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текстGGUF2025

Kimi-VL

Moonshot AI · Китай

Экономичная MoE-модель зрения (16B, активны 3B) с длинным контекстом и рассуждающей версией. Хорошо разбирает длинные документы и видео.

  • Разбор длинных PDF и презентаций
  • Ответы на вопросы по видео
  • Работа с интерфейсами по скриншотам
Размеры
16B-A3B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
КартинкиGGUF2025

BAGEL

ByteDance Seed · Китай

Единая модель, которая и понимает картинки, и генерирует, и редактирует их по диалогу. Похожа на то, как работают картинки в ChatGPT.

  • Редактирование фото в диалоге
  • Ответы на вопросы по изображению
  • Генерация картинок с пояснениями
Размеры
14B-A7B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
ТекстOllama2023–2025

Llama

Meta · США

Модели, с которых начался массовый open source в ИИ. Огромная экосистема дообученных версий и инструментов.

  • Ассистент для сотрудников
  • Суммаризация встреч и документов
  • Основа для дообучения под отрасль
Размеры
1B – 405B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Картинка + текстGGUF2024–2025

SmolVLM

Hugging Face · Франция / США

Самые маленькие модели зрения Hugging Face: от 256M, работают в браузере и на телефоне. SmolVLM2 понимает и видео.

  • Описание фото и видео на слабом железе
  • Чтение простых документов
  • Встраивание в мобильные и офлайн-приложения
Размеры
256M – 2.2B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Агенты для компьютераGGUF2025

UI-TARS

ByteDance Seed · Китай

Модель, которая смотрит на скриншот и сама двигает мышью и клавиатурой: кликает, заполняет поля, переходит по меню. Открыты 1-е поколение и 1.5-7B; UI-TARS-2 весов не открыл.

  • Работа в старых программах без API
  • Заполнение форм и перенос данных между системами
  • Автотесты интерфейсов по сценарию на обычном языке
Размеры
2B – 72B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Агенты для компьютераGGUF2025

Magma

Microsoft Research · США

Модель-агент, которая одинаково планирует действия и в интерфейсе (кнопки на экране), и для робота (движения манипулятора). Пока скорее исследовательская база, чем готовый продукт.

  • Пилоты по управлению интерфейсом
  • Исследовательские проекты на стыке экрана и робототехники
  • Разбор скриншотов с планом действий
Размеры
8B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Картинка + текстGGUF2024–2025

Janus

DeepSeek · Китай

Одна модель и понимает картинки, и рисует их по описанию. Janus-Pro-7B была заметна в начале 2025 года, но по качеству картинок уступает специализированным моделям.

  • Ответы на вопросы по картинкам
  • Черновые иллюстрации по описанию
  • Эксперименты с единой моделью зрения и генерации
Размеры
1B – 7B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Картинка + текст2023–2025

VideoLLaMA

Alibaba DAMO Academy · Китай

Модели, которые смотрят видео и отвечают на вопросы о нём: что происходит, в какой момент, кто что делает. VideoLLaMA 3 на 2B и 7B — одни из сильнейших в своём размере.

  • Описание и краткий пересказ видео
  • Поиск момента в записи по вопросу
  • Разметка видеоархива
Размеры
2B – 72B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Картинка + текстGGUF2024

PaliGemma

Google · США

Модель зрения Google на базе Gemma, задуманная как основа для дообучения под узкую задачу: подписи, поиск объектов, чтение текста.

  • Дообучение под свою задачу распознавания
  • Поиск объектов на фото
  • Чтение текста на изображениях
Размеры
3B – 28B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Картинка + текстНе развивается2023–2024

IDEFICS

Hugging Face · Франция / США

Открытые модели зрения от Hugging Face, воспроизводившие закрытую Flamingo. Idefics3 стала основой для компактной линейки SmolVLM.

  • Ответы на вопросы по картинкам
  • Разбор документов и скриншотов
  • Основа для дообучения
Размеры
8B – 80B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Документы и OCRНе развивается2024

Kosmos-2.5

Microsoft · США

Превращает скан страницы в размеченный текст с координатами блоков или в markdown. Удобна как первый шаг перед разбором резюме. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.

  • Перевод сканов резюме в текст с сохранением структуры
  • Подготовка документов к извлечению полей
  • Оцифровка бумажных анкет
Размеры
около 1.4B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Картинка + текстНе развивается2024

Florence-2

Microsoft · США

Очень маленькая модель зрения: подписи, поиск объектов, сегментация и чтение текста по одной команде. Работает даже на процессоре.

  • Чтение текста на фото
  • Поиск и выделение объектов
  • Автоматические подписи к фото
Размеры
0.23B – 0.77B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCRНе развивается2024

UDOP

Microsoft · США

Одна модель на все задачи с документом: чтение, ответы на вопросы по странице, извлечение полей, классификация. В HR применяется для разбора резюме и приложенных сканов. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.

  • Извлечение полей из резюме и приложений к нему
  • Ответы на вопросы по содержимому документа
  • Классификация входящих документов
Размеры
742M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
МедицинаНе развивается2023

RadFM

Шанхайский университет Цзяо Тун и Shanghai AI Lab · Китай

Ранняя общая модель для радиологии: понимает 2D- и 3D-снимки (КТ, МРТ) вместе с текстом. Скорее исследовательская база. Не заменяет врача, решения принимает специалист.

  • Исследовательские пилоты по разбору КТ и МРТ
  • Подсказки при разборе снимков для врача
  • Основа для своего дообучения на снимках клиники
Размеры
размер на карточке не указан
Железо
от: 1 видеокарта
Коммерция с условиямиПодробнее
Картинка + текстНе развивается2023

Pix2Struct

Google · США

Читает документ или скриншот как картинку и отвечает структурой: текст, поля, ответы на вопросы. В HR её дообучают под резюме и анкеты. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.

  • Извлечение данных из резюме и анкет в виде картинок
  • Вопросы к содержимому скана
  • Разбор таблиц и схем в документах
Размеры
282M – 1.3B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Документы и OCRНе развивается2022

Donut

NAVER CLOVA · Южная Корея

Читает скан документа и сразу отдаёт заполненную структуру полей, без отдельного OCR. В HR её дообучают под разбор резюме и анкет. Решение о кандидате принимает человек, автоматический отбор без проверки использовать нельзя.

  • Извлечение полей из анкет и резюме
  • Разбор сканов справок и дипломов
  • Определение типа входящего документа
Размеры
около 200M
Железо
от: Ноутбук
Можно в коммерциюПодробнее

Подборки

Нужна модель под вашу задачу?

Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.

  1. ПодберуМодель и размер под задачу и бюджет на железо
  2. ПоставлюНа ваш сервер или в закрытый контур, с API
  3. ДообучуНа ваших данных или подключу базу знаний
  4. ВстроюВ CRM, 1С, бота, сайт или рабочий чат
Обсудить внедрение