GME (General Multimodal Embedding)
Один вектор и для текста, и для картинки, и для их пары: одной моделью можно искать товар по фото, страницу документа по вопросу и картинку по описанию. Языки в карточке: английский и китайский.
- Разработчик
- Alibaba (Tongyi Lab), Китай
- Первый выпуск
- дек 2024
- Последний выпуск
- дек 2024
- Размеры
- 2B и 7B
- Лицензия
- Можно в коммерциюApache 2.0
- Русский язык
- Нет
- Запуск
- Через свой серверНужна видеокарта
- Сферы
- Торговля и маркетплейсы, Документы и бухгалтерия, Медиа и продакшн, Разработка ПО
Какие задачи решает
- Поиск товара по фотографии
- Поиск по каталогу картинок и карточек
- Поиск по страницам документов как по изображениям
Где применяется
Требования к железу
Версии
- gme-Qwen2-VL-2B-Instruct и gme-Qwen2-VL-7B-Instruct
Как запустить
Ставлю и настраиваю под ключ: подберу размер модели, разверну на вашем сервере, подключу к вашим системам.
Частые вопросы
Можно ли использовать GME (General Multimodal Embedding) в коммерческом проекте?
Да. Лицензия: Apache 2.0. Это разрешает коммерческое использование, но перед запуском лицензию всё равно стоит показать юристу.
Какое железо нужно для GME (General Multimodal Embedding)?
Минимум: Одна видеокарта на 16–80 ГБ — средние версии. Без видеокарты модель практически не работает. Точный объём видеопамяти под ваш размер модели и контекст можно посчитать в калькуляторе железа.
Поддерживает ли GME (General Multimodal Embedding) русский язык?
Нет. В документации разработчика языки перечислены, русского среди них нет. Для русских задач лучше взять модель из подборки «Открытые ИИ-модели с русским языком».
Где скачать GME (General Multimodal Embedding) и сколько это стоит?
Веса GME (General Multimodal Embedding) лежат в открытом доступе и скачиваются бесплатно. Платить нужно только за железо, на котором модель работает, и за настройку. Ссылки на первоисточник — в конце страницы.
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Поиск по PDF и сканам как по картинкам: страницу не нужно распознавать, модель сразу находит нужную по вопросу, включая таблицы и схемы. Обучены на английском.
ПодробнееПоиск по сканам документовVLM2VecTIGER-Lab · КанадаМожно в коммерциюПревращает модель «картинка плюс текст» в модель эмбеддингов: один вектор для страницы, схемы или фото с подписью. В карточке заявлен английский язык.
ПодробнееКомпьютерное зрениеSigLIP (наследник CLIP)Google · СШАМожно в коммерциюМодели, которые переводят картинки и текст в общее пространство: можно искать фото по словам и классифицировать изображения без обучения. CLIP от OpenAI (2021) — предшественник.
ПодробнееИсточник: huggingface.co/Alibaba-NLP/gme-Qwen2-VL-7B-Instruct. Данные сверены с карточкой модели 22.09.2026. Лицензию перед коммерческим запуском проверьте с юристом.


