VLM2Vec
Превращает модель «картинка плюс текст» в модель эмбеддингов: один вектор для страницы, схемы или фото с подписью. В карточке заявлен английский язык.
- Разработчик
- TIGER-Lab, Канада
- Первый выпуск
- окт 2024
- Последний выпуск
- окт 2024
- Размеры
- около 4B (на базе Phi-3.5-V)
- Лицензия
- Можно в коммерциюApache 2.0
- Русский язык
- Нет
- Запуск
- Через свой серверНужна видеокарта
- Сферы
- Документы и бухгалтерия, Торговля и маркетплейсы, Наука, Медиа и продакшн
Какие задачи решает
- Поиск по смешанному архиву текстов и картинок
- Поиск по страницам документов как по изображениям
- Подбор похожих карточек и иллюстраций
Где применяется
Требования к железу
Версии
- VLM2Vec-Full и VLM2Vec-LoRA
Как запустить
Ставлю и настраиваю под ключ: подберу размер модели, разверну на вашем сервере, подключу к вашим системам.
Частые вопросы
Можно ли использовать VLM2Vec в коммерческом проекте?
Да. Лицензия: Apache 2.0. Это разрешает коммерческое использование, но перед запуском лицензию всё равно стоит показать юристу.
Какое железо нужно для VLM2Vec?
Минимум: Одна видеокарта на 16–80 ГБ — средние версии. Без видеокарты модель практически не работает. Точный объём видеопамяти под ваш размер модели и контекст можно посчитать в калькуляторе железа.
Поддерживает ли VLM2Vec русский язык?
Нет. В документации разработчика языки перечислены, русского среди них нет. Для русских задач лучше взять модель из подборки «Открытые ИИ-модели с русским языком».
Где скачать VLM2Vec и сколько это стоит?
Веса VLM2Vec лежат в открытом доступе и скачиваются бесплатно. Платить нужно только за железо, на котором модель работает, и за настройку. Ссылки на первоисточник — в конце страницы.
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Один вектор и для текста, и для картинки, и для их пары: одной моделью можно искать товар по фото, страницу документа по вопросу и картинку по описанию. Языки в карточке: английский и китайский.
ПодробнееПоиск по сканам документовColPali / ColQwenIlluin Technology (команда ViDoRe) · ФранцияКоммерция с условиямиПоиск по PDF и сканам как по картинкам: страницу не нужно распознавать, модель сразу находит нужную по вопросу, включая таблицы и схемы. Обучены на английском.
ПодробнееКомпьютерное зрениеSigLIP (наследник CLIP)Google · СШАМожно в коммерциюМодели, которые переводят картинки и текст в общее пространство: можно искать фото по словам и классифицировать изображения без обучения. CLIP от OpenAI (2021) — предшественник.
ПодробнееИсточник: huggingface.co/TIGER-Lab/VLM2Vec-Full. Данные сверены с карточкой модели 22.09.2026. Лицензию перед коммерческим запуском проверьте с юристом.


