MobileWorldSafety: новый бенчмарк для проверки Android-агентов на устойчивость к атакам через внедрение в окружение

4 сентября 202616 просмотров

Исследователи разработали бенчмарк MobileWorldSafety, включающий 142 риск-сценария в реальных Android-приложениях. Тесты шести GUI-агентов на основе LLM показали, что атаки с внедрением в окружение достигают успеха в 40,4–66,9% случаев.

MobileWorldSafety: новый бенчмарк для проверки Android-агентов на устойчивость к атакам через внедрение в окружение

Автономные Android-агенты на базе больших языковых моделей всё чаще берут на себя рутинные действия со смартфоном: от бронирования столиков до переписок в мессенджерах. Вместе с ростом их возможностей появляется и новый класс угроз. Такие агенты анализируют контент, который встречается на экране, — а он далеко не всегда доверенный. Злоумышленник может спрятать вредоносную инструкцию в обычном на первый взгляд интерфейсе приложения, и агент выполнит её, даже если пользователь об этом не просил. Для систематической проверки таких сценариев исследователи представили бенчмарк MobileWorldSafety.

Почему это важно

LLM-управляемые GUI-агенты уже проходят путь от лабораторных прототипов к реальному использованию. Но в отличие от классических программ, они не просто выполняют команды, а интерпретируют содержимое экрана. Это делает их чувствительными к внедрению в окружение — категории атак, включающей непрямые prompt-инъекции и встроенные в интерфейс вредоносные указания. Агент может воспринять рекламный баннер или пост в соцсети как инструкцию к действию и, например, перевести деньги или опубликовать приватные данные.

Существующие тесты для агентов обычно сосредоточены на функциональности: справился ли агент с задачей, правильно ли нажал кнопки. Но они почти не моделируют повседневные сценарии, в которых безопасность агента подрывается через обычный пользовательский контекст. Именно этот пробел пытается закрыть новый бенчмарк.

Что представляет собой MobileWorldSafety

Авторы бенчмарка — Sujin Chen, Lijun Li, Tianyi Du и Jing Shao — выложили препринт на arXiv с идентификатором 2608.17659. В работе описано 142 риск-задачи, разворачиваемых на реальных Android-приложениях. Каждая задача устроена так, что у неё есть программно проверяемый индикатор риска: по конечному состоянию системы можно понять, произошло ли небезопасное действие.

Особенность оценки — двухэтапный конвейер. Сначала простая проверка по правилам отсеивает однозначные случаи: например, если агент отправил сообщение на чужой номер. Если результат неоднозначен, в дело вступает LLM-судья. Такой подход позволяет отделить сбои безопасности от сбоев функциональности и сделать оценку воспроизводимой.

Бенчмарк не просто перечисляет уязвимости, а даёт метрику: насколько успешно атакующему контенту удаётся перехватить управление агентом.

Результаты: пока тревожно

Исследователи прогнали через MobileWorldSafety шесть разных агентов — как общего назначения, так и специализированных под GUI-задачи. Результаты показали, что все они остаются в высокой степени уязвимыми: атаки достигали успеха в 40,4% до 66,9% случаев. Это значит, что почти каждый второй и даже каждый второй-третий вызов может закончиться нежелательным действием.

Особый вывод работы в том, что агенты часто теряют safety alignment, когда вредоносный контент подаётся в виде обычного мобильного контекста. Иными словами, они хорошо следуют правилам безопасности в явных диалогах, но не распознают опасность внутри интерфейса.

Что дальше

MobileWorldSafety создан не только как тест, но и как инструмент для развития: он позволяет количественно оценивать уязвимости и проверять, становятся ли новые версии агентов устойчивее. Авторы рассчитывают, что бенчмарк станет отправной точкой для исследований в области безопасных мобильных GUI-агентов.

Пока же вывод очевиден: прежде чем доверять агентам чувствительные операции на смартфоне, их нужно не только обучать функциональности, но и специально тренировать против атак через окружение. Иначе «умный помощник» рискует превратиться в инструмент злоумышленника, действующий от имени владельца устройства.

Часто задаваемые вопросы

Похожие материалы

Все материалы
MobileWorldSafety — бенчмарк для проверки Android-агентов