Картинка + текст
PaliGemma
Модель зрения Google на базе Gemma, задуманная как основа для дообучения под узкую задачу: подписи, поиск объектов, чтение текста.
- Разработчик
- Google, США
- Первый выпуск
- май 2024
- Последний выпуск
- ноя 2024
- Размеры
- 3B – 28B
- Лицензия
- Коммерция с условиямиGemma Terms of Use (коммерция разрешена с правилами использования)
Какие задачи решает
- Дообучение под свою задачу распознавания
- Поиск объектов на фото
- Чтение текста на изображениях
- Подписи к фото
Где применяется
ПромышленностьРозницаИсследовательские команды
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходитКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- PaliGemma 2 (3B, 10B, 28B)
- PaliGemma 3B
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
ТекстGemmaGoogle · СШАМожно в коммерцию
Компактные модели Google: хорошо работают на одном компьютере, старшие версии понимают картинки.
ПодробнееКартинка + текстFlorence-2Microsoft · СШАМожно в коммерциюОчень маленькая модель зрения: подписи, поиск объектов, сегментация и чтение текста по одной команде. Работает даже на процессоре.
ПодробнееКартинка + текстQwen-VLAlibaba (команда Qwen) · КитайМожно в коммерциюОдна из сильнейших открытых моделей зрения: читает документы, таблицы, графики, видео, работает с интерфейсами. С Qwen3.5 зрение встроено прямо в основную модель Qwen.
Подробнее

