Картинка + текст
Molmo
Полностью открытые модели зрения Ai2 (веса и данные). Умеют указывать точку на картинке и считать предметы; Molmo2 понимает видео, MolmoWeb управляет браузером.
- Разработчик
- Ai2 (Allen Institute for AI), США
- Первый выпуск
- сен 2024
- Последний выпуск
- мар 2026
- Размеры
- 1B-A7B – 72B
- Лицензия
- Можно в коммерциюApache 2.0
Какие задачи решает
- Подсчёт товаров и объектов на фото
- Указание, где на снимке нужный предмет
- Разбор видео
- Агент, работающий с сайтами (MolmoWeb)
Где применяется
Склад и розницаПромышленностьИсследовательские команды
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходитКластерСервер с несколькими видеокартами — флагманские версии
подходитВерсии
- MolmoPoint и MolmoWeb
- Molmo2 4B / 8B
- Molmo 7B / 72B и MolmoE-1B
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Картинка + текстQwen-VLAlibaba (команда Qwen) · КитайМожно в коммерцию
Одна из сильнейших открытых моделей зрения: читает документы, таблицы, графики, видео, работает с интерфейсами. С Qwen3.5 зрение встроено прямо в основную модель Qwen.
ПодробнееКартинка + текстMoondreamMoondream (M87 Labs) · СШАКоммерция с условиямиНебольшая и быстрая модель зрения для продуктовых задач: ответы на вопросы, поиск и указание объектов, подписи. Moondream 3.1 — MoE на 9B с 2B активных.
ПодробнееРоботыMolmoActAi2 (Allen Institute for AI) · СШАМожно в коммерциюПолностью открытая модель управления роботом, которая сначала «рассуждает» о пространстве и траектории, а потом действует. Ход рассуждений можно проверить.
Подробнее

