移动世界安全:用于测试Android智能体对环境注入攻击鲁棒性的新基准

4 九月 202616 视图

研究人员开发了MobileWorldSafety基准测试,涵盖142个真实Android应用中的风险场景。对六个基于LLM的GUI代理的测试显示,环境注入攻击的成功率在40.4%至66.9%之间。

移动世界安全:用于测试Android智能体对环境注入攻击鲁棒性的新基准

基于大语言模型的自主Android智能体正越来越多地承担起智能手机上的日常操作:从预订餐厅到在即时通讯软件中回复消息。随着其能力的增长,也出现了一类新的威胁。这类智能体会分析屏幕上出现的内容——而这些内容并不总是可信的。攻击者可以将恶意指令隐藏在看似普通的应用界面中,智能体即使未收到用户请求,也可能会执行该指令。为了系统性地检验此类场景,研究人员推出了MobileWorldSafety基准测试。

为什么这很重要

由LLM驱动的GUI智能体正从实验室原型走向实际应用。但与经典程序不同,它们不仅仅是执行命令,还会解读屏幕内容。这使得它们对环境注入高度敏感——这是一类攻击,包括间接提示注入和嵌入界面中的恶意指令。智能体可能会将广告横幅或社交媒体帖子视为操作指令,并据此执行操作,例如转账或泄露隐私数据。

现有的智能体测试通常侧重于功能性:智能体是否完成了任务、是否正确点击了按钮。但它们几乎不模拟日常场景,即智能体的安全性因普通用户环境而受到破坏。新基准测试正是试图填补这一空白。

MobileWorldSafety是什么

该基准测试的作者——Sujin Chen、Lijun Li、Tianyi Du和Jing Shao——已在arXiv上发布了预印本,标识符为2608.17659。该工作描述了142个风险任务,部署在真实的Android应用上。每个任务都设计为具有可编程验证的风险指标:通过系统的最终状态可以判断是否发生了不安全操作。

评估的特别之处在于两阶段流水线。首先,基于规则的简单检查会筛除明确的情况:例如,智能体向陌生号码发送了消息。如果结果不明确,则由LLM裁判介入。这种方法可以将安全故障与功能性故障区分开来,并使评估具有可复现性。

该基准测试不仅列出了漏洞,还提供了一个指标:攻击性内容在多大程度上能够成功劫持智能体的控制权。

结果:目前令人担忧

研究人员使用MobileWorldSafety测试了六个不同的智能体——既有通用型的,也有专门针对GUI任务的。结果显示,它们都仍然高度脆弱:攻击成功率在40.4%到66.9%之间。这意味着,几乎每两次调用中就有一次,甚至每两到三次调用中就有一次,可能以非预期操作告终。

该工作的一个特别结论是,当恶意内容以普通移动环境的形式呈现时,智能体往往会失去安全对齐。换句话说,它们在明确的对话中能很好地遵循安全规则,但无法识别界面内部的危险。

未来展望

MobileWorldSafety不仅作为一个测试,也作为一种发展工具而创建:它能够量化评估漏洞,并检验新版本智能体是否变得更加稳健。作者希望该基准测试能成为安全移动GUI智能体研究的起点。

目前结论显而易见:在将敏感操作托付给智能体之前,不仅需要训练其功能性,还需要专门针对环境攻击进行训练。否则,“智能助手”就有可能沦为攻击者的工具,以设备所有者的名义行事。

常问问题

移动世界安全:用于测试Android智能体对环境注入攻击鲁棒性的新基准