AI для разработчиков 5 мин чтения

ИИ, который видит экран телефона: зрительные модели прямо на устройстве

Зрительные модели научились не просто описывать картинки, а читать экраны приложений и точно показывать, где на них что находится — и всё это в 3 млрд параметров прямо на телефоне, без облака. Разбираю на примере Liquid AI LFM2.5-VL-3B, зачем это бизнесу: автоматизация интерфейсов, доступность и обработка изображений без утечки данных.

ИИvisionна устройствеавтоматизация2026
Появился новый класс лёгких зрительных моделей: они не «описывают картинку», а понимают интерфейс и выдают координаты элемента — куда нажать. По данным Liquid AI, их модель LFM2.5-VL-3B на 3 млрд параметров работает прямо на смартфоне, требует около 3 ГБ памяти и обгоняет модели вдвое крупнее. Для бизнеса это автоматизация действий по экрану, доступность и обработка данных без облака.

Про зрительный ИИ на устройстве я уже писал: Moondream на ноутбуке, привязка объектов через LocateAnything, OCR-модели без облака. Всё это про то, как ИИ читает фото и бумаги. Здесь — про новое: модель читает экраны и интерфейсы прямо на телефоне и точно показывает, куда нажать.

Что нового: ИИ читает не текст, а экран

Раньше зрительная модель работала как «подпись к картинке»: покажешь скриншот — она опишет, что видит. Полезно, но пассивно. Новый шаг — модель понимает структуру интерфейса: вот кнопка «Оплатить», вот поле ввода, вот галочка согласия — и выдаёт координаты элемента на экране.

Разница принципиальная. Одно дело — прочитать экран, другое — сказать «нажми вот сюда» с точностью до пикселя. Именно это открывает автоматизацию. В индустрии это называют grounding — привязка того, что модель «видит», к точке на экране.

Повод — анонс Liquid AI: компания выпустила открытую зрительно-языковую модель LFM2.5-VL-3B (доступна на Hugging Face). По заявлению разработчиков, при всего ~3 млрд параметров она обгоняет модели вдвое крупнее в задачах по интерфейсам, привязке объектов и распознаванию текста.

Ориентир — тест ScreenSpot-v2 («найди элемент на экране»). В анонсе заявлено 80,7 против 51,2 у сопоставимой Gemma-4-E4B. Оговорюсь: это цифры вендора, не проверенные независимо. Но даже со скидкой сам сдвиг — от «описываю» к «показываю, куда нажать» — реальный.

Почему «на телефоне» — это важно

Ключевое не в баллах, а в двух числах: около 3 ГБ памяти и работает на смартфоне. По данным Liquid AI, на Galaxy S26 Ultra — порядка 20 токенов в секунду, на мощном ПК (Apple M5 Max) — до 228. Модель помещается в карман. Что это даёт:

  • Приватность. Скриншоты и данные не уходят наружу. Для бизнеса в РФ это прямой плюс по 152-ФЗ: если персональные данные не покидают устройство, снимается пласт рисков.
  • Скорость. Нет похода в облако и обратно — отклик без сетевой задержки.
  • Офлайн. Работает без интернета — на объекте, в поле, где связи нет.
  • Стоимость. Нет платы за токены: один раз развернул — дальше считает бесплатно.

Это продолжение линии из текста про ИИ-агента на своём ПК: чем больше умного локально, тем меньше зависимости от чужих серверов.

Где применить в бизнесе

Самое интересное — когда модель, «видящая интерфейс», встраивается в процессы. Четыре осмысленных сценария:

СценарийЧто делает модель
Автоматизация в приложениях без API«Видит» экран и проходит сценарий как человек: находит поле, нажимает кнопку, переносит данные
ДоступностьЧитает экран вслух и подсказывает незрячим или пожилым, куда нажать
Тестирование интерфейсовПроверяет, что элементы на месте и приложение выглядит правильно
Фото и документы на устройствеРаспознаёт изображения и бумаги локально, без облака

Автоматизация без API — самое ценное. У многих старых и корпоративных систем нет интерфейса для интеграции: только окно, кнопки и поля. Обычно такое либо автоматизируют хрупкими скриптами «по координатам», либо оставляют людям. Модель, видящая экран, проходит рутинный сценарий — заполнить форму, перенести данные между программами.

Доступность — недооценённая ниша: помощник читает экран и объясняет незрячим или пожилым, куда нажать, работая офлайн.

Контроль интерфейсов: открылся нужный экран? кнопка на месте? нет ли пустого поля вместо цены? Дешёвый способ ловить визуальные баги. Четвёртый сценарий — обработка фото и документов — не расписываю: это уже разобранная тема, см. OCR-модели без облака. Важно, что одна лёгкая модель закрывает и интерфейсы, и картинки из реального мира.

Граница: что такая модель не делает

Теперь честно. 3 млрд параметров — это маленькая модель. Она отлично видит и локализует, но не заменяет сложное рассуждение. Если нужны логика и разбор неоднозначных ситуаций — нужна модель побольше. На практике это часто связка: лёгкая модель «видит экран», а тяжёлая думает — идея маршрутизации между моделями.

Второе. Автоматизация «по экрану» медленнее и хрупче, чем интеграция через API: поменялся дизайн, съехала кнопка — и сценарий сломался. Правило: если API есть — интегрируйтесь через него. Чтение экрана — для случаев, когда API нет.

Третье. Все цифры в анонсе — заявления вендора. Пока нет независимых замеров, отношусь к ним как к ориентиру, а не как к доказанному факту.

Давать ИИ доступ к экрану — это доступ к тому, что на экране: чужим приложениям, переписке, персональным данным сотрудников.

И четвёртое, юридическое. Чтение чужих экранов — вопросы приватности и правил сервисов. Нельзя ставить такое на слежку за сотрудниками без их ведома или в обход 152-ФЗ. Применять нужно аккуратно.

Частые вопросы

Нужен ли интернет или облако? Нет. Модель работает на самом устройстве — телефоне или ПК. Данные наружу не уходят. Это её главное преимущество перед облачными сервисами.

Заменит ли это интеграцию через API? Нет. Если у программы есть API — интегрируйтесь через него: быстрее и надёжнее. Чтение экрана нужно там, где API нет: старое ПО, закрытые приложения без документации.

Какой телефон это потянет? По заявлению разработчиков, модели хватает около 3 ГБ памяти, и она запускается на современных флагманах — в анонсе фигурирует Galaxy S26 Ultra. На слабых — медленнее.

Законно ли давать ИИ доступ к экрану? Если это ваши устройства и процессы — да. Проблемы начинаются с чужих данных или скрытого наблюдения за людьми: тут нужны согласие, прозрачность и соответствие 152-ФЗ. Не всё, что можно технически, законно.

Коротко о главном

  • Зрительные модели перешли от «описываю картинку» к «понимаю интерфейс и показываю, куда нажать» — с координатами элемента.
  • Повод — открытая модель Liquid AI LFM2.5-VL-3B: по заявлению, 3 млрд параметров, около 3 ГБ памяти, работает на смартфоне и обгоняет модели вдвое крупнее.
  • Локально — значит приватно (важно для 152-ФЗ), быстро, офлайн, без платы за токены.
  • Применение: автоматизация приложений без API, доступность, контроль интерфейсов, обработка фото.
  • Граница трезвая: маленькая модель не заменяет рассуждение, экранная автоматизация хрупче API, бенчмарки — пока заявления вендора.

Если у вас есть процесс на приложении без API или задача с распознаванием на устройстве без утечки данных — это ровно та область, где я помогаю внедрить локальный ИИ. Напишите — разберём предметно.

Услуги по теме

Что я делаю с локальным зрительным ИИ

  • Распознавание фото и документов на устройстве
  • Автоматизация действий по экрану приложения
  • Всё локально, без отправки в облако
  • Соответствие 152-ФЗ

Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»

12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.

Готовы обсудить вашу задачу?

Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.

Пишу о разработке, ИИ и законах для бизнеса

Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.

Готовые решения под ключ 449 готовых IT-решений для бизнеса Автоматизация, боты, AI, 152-ФЗ и платформы · бесплатная консультация Смотреть каталог