Картинка + текстКомпьютерное зрение
Florence-2
Очень маленькая модель зрения: подписи, поиск объектов, сегментация и чтение текста по одной команде. Работает даже на процессоре.
- Разработчик
- Microsoft, США
- Первый выпуск
- июн 2024
- Последний выпуск
- июн 2024
- Размеры
- 0.23B – 0.77B
- Лицензия
- Можно в коммерциюMIT
Какие задачи решает
- Чтение текста на фото
- Поиск и выделение объектов
- Автоматические подписи к фото
- Разметка данных для обучения
Где применяется
ПромышленностьРозницаРазметка данных
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версийКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- Florence-2 base / large
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Картинка + текстPaliGemmaGoogle · СШАКоммерция с условиями
Модель зрения Google на базе Gemma, задуманная как основа для дообучения под узкую задачу: подписи, поиск объектов, чтение текста.
ПодробнееКартинка + текстMoondreamMoondream (M87 Labs) · СШАКоммерция с условиямиНебольшая и быстрая модель зрения для продуктовых задач: ответы на вопросы, поиск и указание объектов, подписи. Moondream 3.1 — MoE на 9B с 2B активных.
ПодробнееКомпьютерное зрениеGrounding DINO / Rex-OmniIDEA Research · КитайКоммерция с условиямиНаходит на картинке любые объекты по текстовому описанию, без обучения на своих данных: «красная коробка», «человек без каски». Rex-Omni — новое поколение на базе VLM.
Подробнее

