Картинка + текстДокументы и OCR
A-Vision (Авито)
Русскоязычная модель Авито, которая понимает картинки: описывает фото, отвечает на вопросы по изображению, читает надписи. Основа Qwen2.5-VL, на русском быстрее исходной.
- Разработчик
- Авито Тех, Россия
- Первый выпуск
- окт 2025
- Последний выпуск
- окт 2025
- Размеры
- 7.4B
- Лицензия
- Можно в коммерциюApache 2.0
- Русский язык
- Есть
- Запуск
- Через свой серверНужна видеокарта
- Сферы
- Торговля и маркетплейсы, Маркетинг и контент, Документы и бухгалтерия
Какие задачи решает
- Описание товара по фото на русском
- Проверка, что фото совпадает с описанием
- Чтение брендов и надписей на картинках
Где применяется
Маркетплейсы и доски объявленийМодерация карточек товаровКаталоги интернет-магазинов
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
нет версий1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходитКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- A-Vision
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Картинка + текстQwen-VLAlibaba (команда Qwen) · КитайМожно в коммерцию
Одна из сильнейших открытых моделей зрения: читает документы, таблицы, графики, видео, работает с интерфейсами. С Qwen3.5 зрение встроено прямо в основную модель Qwen.
ПодробнееКартинка + текстInternVLShanghai AI Laboratory (OpenGVLab) · КитайМожно в коммерциюБольшая линейка китайских моделей зрения с размерами от 1B до 241B. InternVL-U (4B) объединяет понимание картинок, их генерацию и редактирование.
ПодробнееКартинка + текстMiniCPM-VOpenBMB (ModelBest и Университет Цинхуа) · КитайМожно в коммерциюКомпактные модели зрения, которые работают даже на телефоне и ноутбуке. Хорошо читают текст на фото, понимают видео; версия 4.6 весит всего 1.3B.
Подробнее

