Картинка + текст

CogVLM и GLM-V

Модели зрения от Zhipu: сначала CogVLM, затем линейка GLM-V. GLM-4.6V умеет вызывать инструменты по картинкам и работать как агент с интерфейсом.

Разработчик
Zhipu AI (Z.ai) и Университет Цинхуа, Китай
Первый выпуск
ноя 2023
Последний выпуск
дек 2025
Размеры
9B – 106B-A12B
Лицензия
Можно в коммерциюGLM-4.1V / 4.5V / 4.6V — MIT; CogVLM и CogVLM2 — собственные лицензии (CogVLM2 на базе Llama 3)

Какие задачи решает

  • Ответы на вопросы по фото и документам
  • Агент, работающий с интерфейсом по скриншотам
  • Разбор графиков и отчётов
  • Подписи к фото и видео

Где применяется

ДокументооборотСлужбы поддержкиАналитика

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходит
КластерСервер с несколькими видеокартами — флагманские версии
подходит

Версии

  1. GLM-4.6V и GLM-4.6V-Flash 9B
  2. GLM-4.5V 106B-A12B
  3. GLM-4.1V-9B-Thinking
  4. CogVLM2 19B
  5. CogAgent
  6. CogVLM-17B

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели