ИИ, который видит экран телефона: зрительные модели прямо на устройстве
Зрительные модели научились не просто описывать картинки, а читать экраны приложений и точно показывать, где на них что находится — и всё это в 3 млрд параметров прямо на телефоне, без облака. Разбираю на примере Liquid AI LFM2.5-VL-3B, зачем это бизнесу: автоматизация интерфейсов, доступность и обработка изображений без утечки данных.
Про зрительный ИИ на устройстве я уже писал: Moondream на ноутбуке, привязка объектов через LocateAnything, OCR-модели без облака. Всё это про то, как ИИ читает фото и бумаги. Здесь — про новое: модель читает экраны и интерфейсы прямо на телефоне и точно показывает, куда нажать.
Что нового: ИИ читает не текст, а экран
Раньше зрительная модель работала как «подпись к картинке»: покажешь скриншот — она опишет, что видит. Полезно, но пассивно. Новый шаг — модель понимает структуру интерфейса: вот кнопка «Оплатить», вот поле ввода, вот галочка согласия — и выдаёт координаты элемента на экране.
Разница принципиальная. Одно дело — прочитать экран, другое — сказать «нажми вот сюда» с точностью до пикселя. Именно это открывает автоматизацию. В индустрии это называют grounding — привязка того, что модель «видит», к точке на экране.
Повод — анонс Liquid AI: компания выпустила открытую зрительно-языковую модель LFM2.5-VL-3B (доступна на Hugging Face). По заявлению разработчиков, при всего ~3 млрд параметров она обгоняет модели вдвое крупнее в задачах по интерфейсам, привязке объектов и распознаванию текста.
Ориентир — тест ScreenSpot-v2 («найди элемент на экране»). В анонсе заявлено 80,7 против 51,2 у сопоставимой Gemma-4-E4B. Оговорюсь: это цифры вендора, не проверенные независимо. Но даже со скидкой сам сдвиг — от «описываю» к «показываю, куда нажать» — реальный.
Почему «на телефоне» — это важно
Ключевое не в баллах, а в двух числах: около 3 ГБ памяти и работает на смартфоне. По данным Liquid AI, на Galaxy S26 Ultra — порядка 20 токенов в секунду, на мощном ПК (Apple M5 Max) — до 228. Модель помещается в карман. Что это даёт:
- Приватность. Скриншоты и данные не уходят наружу. Для бизнеса в РФ это прямой плюс по 152-ФЗ: если персональные данные не покидают устройство, снимается пласт рисков.
- Скорость. Нет похода в облако и обратно — отклик без сетевой задержки.
- Офлайн. Работает без интернета — на объекте, в поле, где связи нет.
- Стоимость. Нет платы за токены: один раз развернул — дальше считает бесплатно.
Это продолжение линии из текста про ИИ-агента на своём ПК: чем больше умного локально, тем меньше зависимости от чужих серверов.
Где применить в бизнесе
Самое интересное — когда модель, «видящая интерфейс», встраивается в процессы. Четыре осмысленных сценария:
| Сценарий | Что делает модель |
|---|---|
| Автоматизация в приложениях без API | «Видит» экран и проходит сценарий как человек: находит поле, нажимает кнопку, переносит данные |
| Доступность | Читает экран вслух и подсказывает незрячим или пожилым, куда нажать |
| Тестирование интерфейсов | Проверяет, что элементы на месте и приложение выглядит правильно |
| Фото и документы на устройстве | Распознаёт изображения и бумаги локально, без облака |
Автоматизация без API — самое ценное. У многих старых и корпоративных систем нет интерфейса для интеграции: только окно, кнопки и поля. Обычно такое либо автоматизируют хрупкими скриптами «по координатам», либо оставляют людям. Модель, видящая экран, проходит рутинный сценарий — заполнить форму, перенести данные между программами.
Доступность — недооценённая ниша: помощник читает экран и объясняет незрячим или пожилым, куда нажать, работая офлайн.
Контроль интерфейсов: открылся нужный экран? кнопка на месте? нет ли пустого поля вместо цены? Дешёвый способ ловить визуальные баги. Четвёртый сценарий — обработка фото и документов — не расписываю: это уже разобранная тема, см. OCR-модели без облака. Важно, что одна лёгкая модель закрывает и интерфейсы, и картинки из реального мира.
Граница: что такая модель не делает
Теперь честно. 3 млрд параметров — это маленькая модель. Она отлично видит и локализует, но не заменяет сложное рассуждение. Если нужны логика и разбор неоднозначных ситуаций — нужна модель побольше. На практике это часто связка: лёгкая модель «видит экран», а тяжёлая думает — идея маршрутизации между моделями.
Второе. Автоматизация «по экрану» медленнее и хрупче, чем интеграция через API: поменялся дизайн, съехала кнопка — и сценарий сломался. Правило: если API есть — интегрируйтесь через него. Чтение экрана — для случаев, когда API нет.
Третье. Все цифры в анонсе — заявления вендора. Пока нет независимых замеров, отношусь к ним как к ориентиру, а не как к доказанному факту.
Давать ИИ доступ к экрану — это доступ к тому, что на экране: чужим приложениям, переписке, персональным данным сотрудников.
И четвёртое, юридическое. Чтение чужих экранов — вопросы приватности и правил сервисов. Нельзя ставить такое на слежку за сотрудниками без их ведома или в обход 152-ФЗ. Применять нужно аккуратно.
Частые вопросы
Нужен ли интернет или облако? Нет. Модель работает на самом устройстве — телефоне или ПК. Данные наружу не уходят. Это её главное преимущество перед облачными сервисами.
Заменит ли это интеграцию через API? Нет. Если у программы есть API — интегрируйтесь через него: быстрее и надёжнее. Чтение экрана нужно там, где API нет: старое ПО, закрытые приложения без документации.
Какой телефон это потянет? По заявлению разработчиков, модели хватает около 3 ГБ памяти, и она запускается на современных флагманах — в анонсе фигурирует Galaxy S26 Ultra. На слабых — медленнее.
Законно ли давать ИИ доступ к экрану? Если это ваши устройства и процессы — да. Проблемы начинаются с чужих данных или скрытого наблюдения за людьми: тут нужны согласие, прозрачность и соответствие 152-ФЗ. Не всё, что можно технически, законно.
Коротко о главном
- Зрительные модели перешли от «описываю картинку» к «понимаю интерфейс и показываю, куда нажать» — с координатами элемента.
- Повод — открытая модель Liquid AI LFM2.5-VL-3B: по заявлению, 3 млрд параметров, около 3 ГБ памяти, работает на смартфоне и обгоняет модели вдвое крупнее.
- Локально — значит приватно (важно для 152-ФЗ), быстро, офлайн, без платы за токены.
- Применение: автоматизация приложений без API, доступность, контроль интерфейсов, обработка фото.
- Граница трезвая: маленькая модель не заменяет рассуждение, экранная автоматизация хрупче API, бенчмарки — пока заявления вендора.
Если у вас есть процесс на приложении без API или задача с распознаванием на устройстве без утечки данных — это ровно та область, где я помогаю внедрить локальный ИИ. Напишите — разберём предметно.
Что я делаю с локальным зрительным ИИ
- Распознавание фото и документов на устройстве
- Автоматизация действий по экрану приложения
- Всё локально, без отправки в облако
- Соответствие 152-ФЗ
Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»
12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.
Готовы обсудить вашу задачу?
Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.
Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.


