Картинка + текст

Molmo

Полностью открытые модели зрения Ai2 (веса и данные). Умеют указывать точку на картинке и считать предметы; Molmo2 понимает видео, MolmoWeb управляет браузером.

Разработчик
Ai2 (Allen Institute for AI), США
Первый выпуск
сен 2024
Последний выпуск
мар 2026
Размеры
1B-A7B – 72B
Лицензия
Можно в коммерциюApache 2.0

Какие задачи решает

  • Подсчёт товаров и объектов на фото
  • Указание, где на снимке нужный предмет
  • Разбор видео
  • Агент, работающий с сайтами (MolmoWeb)

Где применяется

Склад и розницаПромышленностьИсследовательские команды

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходит
КластерСервер с несколькими видеокартами — флагманские версии
подходит

Версии

  1. MolmoPoint и MolmoWeb
  2. Molmo2 4B / 8B
  3. Molmo 7B / 72B и MolmoE-1B

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели