Картинка + текстДокументы и OCR
MiniCPM-V
Компактные модели зрения, которые работают даже на телефоне и ноутбуке. Хорошо читают текст на фото, понимают видео; версия 4.6 весит всего 1.3B.
- Разработчик
- OpenBMB (ModelBest и Университет Цинхуа), Китай
- Первый выпуск
- янв 2024
- Последний выпуск
- май 2026
- Размеры
- 1.3B – 8B
- Лицензия
- Можно в коммерциюApache 2.0 (у ранних версий была собственная лицензия MiniCPM с регистрацией для коммерции)
Какие задачи решает
- Распознавание текста на фото прямо на устройстве
- Разбор чеков и документов без отправки в облако
- Описание фото и видео
- Встроенный помощник в мобильное приложение
Где применяется
Мобильные приложенияРозницаПолевые службы
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходитКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- MiniCPM-V 4.6 и 4.6-Thinking
- MiniCPM-V 4.5
- MiniCPM-V 4.0
- MiniCPM-V 2.6
- MiniCPM-Llama3-V 2.5
- MiniCPM-V 2.0
- MiniCPM-V
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Картинка + текстQwen-VLAlibaba (команда Qwen) · КитайМожно в коммерцию
Одна из сильнейших открытых моделей зрения: читает документы, таблицы, графики, видео, работает с интерфейсами. С Qwen3.5 зрение встроено прямо в основную модель Qwen.
ПодробнееКартинка + текстSmolVLMHugging Face · Франция / СШАМожно в коммерциюСамые маленькие модели зрения Hugging Face: от 256M, работают в браузере и на телефоне. SmolVLM2 понимает и видео.
ПодробнееГолосовые ассистентыMiniCPM-oOpenBMB (ModelBest, Университет Цинхуа) · КитайМожно в коммерциюНебольшая модель, которая видит, слышит и отвечает голосом в реальном времени, может клонировать голос. Голосовой диалог на английском и китайском, текст — на 30+ языках.
Подробнее

