Автономные Android-агенты на базе больших языковых моделей всё чаще берут на себя рутинные действия со смартфоном: от бронирования столиков до переписок в мессенджерах. Вместе с ростом их возможностей появляется и новый класс угроз. Такие агенты анализируют контент, который встречается на экране, — а он далеко не всегда доверенный. Злоумышленник может спрятать вредоносную инструкцию в обычном на первый взгляд интерфейсе приложения, и агент выполнит её, даже если пользователь об этом не просил. Для систематической проверки таких сценариев исследователи представили бенчмарк MobileWorldSafety.
Почему это важно
LLM-управляемые GUI-агенты уже проходят путь от лабораторных прототипов к реальному использованию. Но в отличие от классических программ, они не просто выполняют команды, а интерпретируют содержимое экрана. Это делает их чувствительными к внедрению в окружение — категории атак, включающей непрямые prompt-инъекции и встроенные в интерфейс вредоносные указания. Агент может воспринять рекламный баннер или пост в соцсети как инструкцию к действию и, например, перевести деньги или опубликовать приватные данные.
Существующие тесты для агентов обычно сосредоточены на функциональности: справился ли агент с задачей, правильно ли нажал кнопки. Но они почти не моделируют повседневные сценарии, в которых безопасность агента подрывается через обычный пользовательский контекст. Именно этот пробел пытается закрыть новый бенчмарк.

Что представляет собой MobileWorldSafety
Авторы бенчмарка — Sujin Chen, Lijun Li, Tianyi Du и Jing Shao — выложили препринт на arXiv с идентификатором 2608.17659. В работе описано 142 риск-задачи, разворачиваемых на реальных Android-приложениях. Каждая задача устроена так, что у неё есть программно проверяемый индикатор риска: по конечному состоянию системы можно понять, произошло ли небезопасное действие.
Особенность оценки — двухэтапный конвейер. Сначала простая проверка по правилам отсеивает однозначные случаи: например, если агент отправил сообщение на чужой номер. Если результат неоднозначен, в дело вступает LLM-судья. Такой подход позволяет отделить сбои безопасности от сбоев функциональности и сделать оценку воспроизводимой.
Бенчмарк не просто перечисляет уязвимости, а даёт метрику: насколько успешно атакующему контенту удаётся перехватить управление агентом.
Результаты: пока тревожно
Исследователи прогнали через MobileWorldSafety шесть разных агентов — как общего назначения, так и специализированных под GUI-задачи. Результаты показали, что все они остаются в высокой степени уязвимыми: атаки достигали успеха в 40,4% до 66,9% случаев. Это значит, что почти каждый второй и даже каждый второй-третий вызов может закончиться нежелательным действием.
Особый вывод работы в том, что агенты часто теряют safety alignment, когда вредоносный контент подаётся в виде обычного мобильного контекста. Иными словами, они хорошо следуют правилам безопасности в явных диалогах, но не распознают опасность внутри интерфейса.

Что дальше
MobileWorldSafety создан не только как тест, но и как инструмент для развития: он позволяет количественно оценивать уязвимости и проверять, становятся ли новые версии агентов устойчивее. Авторы рассчитывают, что бенчмарк станет отправной точкой для исследований в области безопасных мобильных GUI-агентов.
Пока же вывод очевиден: прежде чем доверять агентам чувствительные операции на смартфоне, их нужно не только обучать функциональности, но и специально тренировать против атак через окружение. Иначе «умный помощник» рискует превратиться в инструмент злоумышленника, действующий от имени владельца устройства.



