ИИ-агент, который сам управляет смартфоном: что это меняет для бизнеса
Qwen показала набор агентов, которые работают прямо на смартфоне: один разбирает задачу на шаги, второй выполняет её в приложениях, третий делает картинки. Разбираю, что именно заявлено, почему приоритет API над кликами важнее процентов в таблице и какие доступы надо резать до запуска.
Что объявили
Команда Qwen выпустила Qwen Intelligence — набор агентов для смартфонов. В нём три части, и каждая отвечает за свой кусок работы.
Mobile Planner Agent разбирает сложную задачу на шаги и координирует выполнение. Это не исполнитель, а тот, кто решает, из чего задача состоит и в каком порядке её делать.
Mobile-Use Agent выполняет действия в приложениях через API, а при необходимости переключается на графический интерфейс. По данным разработчиков, на бенчмарке MobileWorld он показывает 82,1%, на MobileWorld-Real — 92,2%.
Mobile Creative Agent превращает короткий запрос в готовый визуальный контент. Заявленная генерация изображения — около трёх секунд.
Вместе с агентами Qwen открыла набор бенчмарков: MobilePA-Bench, MobileWorld, MobileWorld-Real и MobileWorld-Safety. Они проверяют планирование, работу между приложениями, поведение на реальных устройствах и безопасность. Последний пункт в этом списке интереснее остальных, и ниже объясню почему.
Источники: сайт Qwen Intelligence, репозиторий планировщика, страница исполнителя, статья про творческого агента, репозиторий MobileWorld.
Что я нашёл в первоисточниках
Прежде чем разбирать содержание, я всегда открываю репозитории по ссылкам из анонса. Здесь картина такая.
Репозиторий планировщика содержит исходники сайта и технического отчёта. В его описании прямо написано, что это не репозиторий для публикации весов, обучающего кода и реализации агента. Раздел релизов пустой.
С исполнителем то же самое: по ссылке лежат исходники страницы проекта, а не модель. Оттуда идёт отсылка к предыдущей линейке той же команды, MAI-UI. У неё веса действительно выложены, две версии на 2 и 8 миллиардов параметров под Apache 2.0, но это релиз декабря 2025 года. Карточки ресурсов на сайте нового агента помечены как «скоро», и в инструкции по правке сайта так и записано: заменить их на ссылки на отчёт, код и чекпоинты в момент релиза.
Третий агент не подтверждается вовсе. Ссылка на статью из анонса ведёт на другую работу, про обучение диффузионных моделей генерации картинок в пространстве пикселей. К мобильным агентам она отношения не имеет. Репозитория с таким названием у команды нет.
Вывод простой. Сейчас это опубликованная заявка на подход и набор бенчмарков, а не инструмент, который можно скачать. Бенчмарки, кстати, выложены по-настоящему, и это само по себе полезно.
Пишу об этом не чтобы придраться. Просто между «вышло» и «можно поставить» в новостях про ИИ регулярно лежит несколько месяцев, и планировать работу по заголовку дороже, чем потратить двадцать минут на проверку.
Чем это отличается от агента в браузере
Агенты, которые кликают по интерфейсу, существуют не первый год. Они смотрят на скриншот, находят кнопку, нажимают, смотрят снова. Такой подход работает, но у него две врождённые болезни.
Первая — хрупкость. Приложение обновилось, кнопка переехала на двадцать пикселей, и сценарий рассыпался. Агент не понимает, что происходит, он видит картинку и ищет на ней знакомое.
Вторая — скорость и стоимость. Каждый шаг это скриншот, его разбор, решение и действие. На десяти шагах это терпимо, на сотне превращается в медленный и дорогой процесс.
Телефон добавляет к этому третью проблему. На компьютере агент работает в окне браузера, и в худшем случае он испортит вкладку. На смартфоне у него под рукой мессенджеры, банк, почта, фотографии, карта, календарь и список контактов. Всё, что определяет человека.
Почему важно, что сначала API, а не экран
Самая содержательная фраза во всём анонсе — про то, что исполнитель действует через API приложений и переключается на графический интерфейс только при необходимости. Это смена подхода, а не улучшение метрики.
Обращение к API — это разговор на языке приложения. Агент не ищет кнопку «Отправить», он вызывает функцию отправки с понятными параметрами. Такое действие проверяемо: видно, что именно вызвали и с чем. Его можно запретить, ограничить, записать в журнал. Клик по экрану записать в журнал тоже можно, но из записи «нажал в точку 640 на 1200» вы ничего не восстановите.
Отсюда практический вывод. Если вы будете выбирать мобильного агента, смотрите не на проценты в таблице, а на то, через что он делает действия. Агент, который умеет в API, дешевле в эксплуатации и, что важнее, поддаётся контролю. Агент, который только тыкает в экран, всегда будет чёрным ящиком с красивой демонстрацией.
Какие задачи это реально закрывает
Я держу в голове простое правило: агент окупается там, где человек делает одинаковую последовательность действий много раз и при этом ничего не решает. Вот куда это ложится на телефоне.
- Разбор входящего в мессенджерах. Заявки приходят в три разных чата, их надо собрать в одно место. Человек делает это копипастом, и делает плохо после шестого раза.
- Публикация контента. Одно и то же объявление в несколько площадок, с подгонкой формата под каждую. Творческий агент из анонса как раз про это.
- Сбор данных с экранов. Есть приложение поставщика без выгрузки, и остатки оттуда переписывают руками в таблицу.
- Рутина выездного сотрудника. Отметиться, сфотографировать, заполнить форму, отправить. Пять действий, которые повторяются двадцать раз за смену.
Заметьте, что во всех четырёх случаях ценность не в интеллекте агента, а в том, что он не устаёт и не пропускает шаги. Именно такие задачи я и беру первыми, когда внедряю агента в бизнес: они дают измеримый результат за неделю и не требуют доверия к машине в спорных решениях.
Где грабли
Теперь неприятная часть, которой в анонсах не бывает.
Агент действует от вашего имени. Он не сторонний сервис, который вы пустили в свой контур. Он сидит внутри ваших сессий, уже авторизованный везде, где авторизованы вы. Если он отправит сообщение не туда, это отправили вы.
Доступы надо резать до запуска. Отдельный телефон или отдельный профиль под рабочие задачи, список приложений, куда агенту можно, и явный запрет на всё остальное. Банк, госуслуги и личная переписка в этот список не входят никогда.
Действия, которые нельзя отменить, остаются за человеком. Отправить, оплатить, удалить, подтвердить. Агент готовит, человек нажимает. Это скучное правило, но оно единственное, которое работает без исключений.
Персональные данные. Телефон сотрудника это чужие контакты, чужая переписка и чужие фотографии. Порядок обработки, сроки хранения и то, что именно попадает в логи агента, стоит в общих чертах обсудить с юристом до внедрения, а не после жалобы.
Отдельно отмечу, что Qwen выпустила бенчмарк MobileWorld-Safety. Сам факт, что безопасность вынесли в отдельный набор проверок, говорит больше, чем проценты из основного теста: разработчики понимают, что агент с доступом к телефону это не про удобство, а про риск.
Как я проверяю такие анонсы
За последний год через меня прошло несколько десятков подобных новостей. Методика у меня одна и довольно занудная.
Первое — ищу веса, а не лендинг. Красивый сайт, статья и таблица с процентами не означают, что модель можно скачать и поставить себе. Половина громких анонсов оказывается описанием архитектуры, а не работающим файлом.
Второе — читаю лицензию целиком, а не строку на карточке. Разные лицензии у кода и у весов встречаются постоянно. Бывает и так, что в карточке стоит свободная лицензия, а в описании репозитория прямо написано ограничение.
Третье — воспроизвожу на своей задаче. Бенчмарк проверяет то, что в бенчмарке. Ваш сценарий с вашими приложениями в него не входит. Я собираю двадцать реальных случаев из работы клиента и прогоняю агента на них вслепую, а результат сверяет человек.
Четвёртое — считаю деньги. Агент на телефоне это либо своё железо, либо оплата за каждый запрос. Пока не посчитан объём обращений в месяц, разговор о внедрении преждевременный.
Ровно так же я разбираю каждую новую открытую модель перед тем, как добавить её в каталог открытых ИИ-моделей: если веса не подтвердились, карточки не будет, даже если анонс громкий.
Частые вопросы
Можно ли уже поставить это себе? Нет. На момент выхода анонса опубликованы страницы проектов, набор бенчмарков и репозитории с исходниками сайтов. Весов нет ни у планировщика, ни у исполнителя, ни у творческого агента. Скачать и поставить сегодня можно только предыдущую линейку той же команды, MAI-UI, релиз декабря 2025 года под Apache 2.0.
Заменит ли такой агент мобильное приложение? Нет. Агент хорош там, где надо повторить действия человека в чужих приложениях, которые вы не контролируете. Если процесс ваш и повторяется каждый день, дешевле и надёжнее сделать нормальную интеграцию или своё приложение.
Нужен ли мощный телефон? Зависит от того, где считается модель. Часть работы может уходить на сервер, часть выполняться на устройстве. Требования к железу проверяются по документации конкретной версии, а не по общему анонсу.
Что с безопасностью на рабочих телефонах сотрудников? Начинать стоит с отдельного устройства или рабочего профиля. Смешивать личный телефон сотрудника и агента с доступами не нужно ни с технической стороны, ни с точки зрения отношений с людьми.
Коротко о главном
Qwen Intelligence интересен не процентами, а тремя вещами: разделением на планировщика, исполнителя и генератор контента, приоритетом API над кликами по экрану и отдельным бенчмарком на безопасность. Первое делает систему разбираемой, второе — управляемой, третье — честной.
Если вы думаете про агента на телефоне, начните не с выбора модели, а с двух вопросов. Какие двадцать повторяющихся действий он снимет с человека и что произойдёт, если он ошибётся на каждом из них. Ответы на эти вопросы определяют всё остальное.
Если хотите разобрать конкретный процесс и понять, есть ли там место агенту, напишите мне. Посмотрю задачу и скажу прямо, нужен ли тут агент или хватит обычной интеграции.
Что я делаю для бизнеса
- Боты в Telegram, MAX, VK
- Автоматизация процессов и CRM
- Аналитика и дашборды
- Сайты и лендинги под ключ
Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»
12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.
Готовы обсудить вашу задачу?
Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.
Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.


