Картинка + текст
IDEFICS
Открытые модели зрения от Hugging Face, воспроизводившие закрытую Flamingo. Idefics3 стала основой для компактной линейки SmolVLM.
- Разработчик
- Hugging Face, Франция / США
- Первый выпуск
- июл 2023
- Последний выпуск
- авг 2024
- Размеры
- 8B – 80B
- Лицензия
- Можно в коммерциюIdefics2 и Idefics3 — Apache 2.0; первая IDEFICS на LLaMA — только для исследований
Какие задачи решает
- Ответы на вопросы по картинкам
- Разбор документов и скриншотов
- Основа для дообучения
Где применяется
Исследовательские командыЭлектронная коммерция
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
нет версий1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходитКластерСервер с несколькими видеокартами — флагманские версии
подходитВерсии
- Idefics3-8B-Llama3
- Idefics2-8B
- IDEFICS 9B / 80B
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Картинка + текстSmolVLMHugging Face · Франция / СШАМожно в коммерцию
Самые маленькие модели зрения Hugging Face: от 256M, работают в браузере и на телефоне. SmolVLM2 понимает и видео.
ПодробнееКартинка + текстLLaVALLaVA / LMMs-Lab (исследователи из США и Китая) · США / КитайМожно в коммерциюОткрытый проект, с которого пошла мода на модели «картинка + текст». Линейка OneVision понимает фото, документы и видео; открыты данные и рецепты обучения.
ПодробнееКартинка + текстMolmoAi2 (Allen Institute for AI) · СШАМожно в коммерциюПолностью открытые модели зрения Ai2 (веса и данные). Умеют указывать точку на картинке и считать предметы; Molmo2 понимает видео, MolmoWeb управляет браузером.
Подробнее

