InjecMEM:一次请求即可接管LLM代理的长期记忆控制权

9 九月 20266 视图

一种新型攻击类别表明,攻击者只需一条消息即可影响代理未来在特定主题上的回答,甚至无需访问记忆存储。研究作者声称,该方法在记忆发生变化时仍能保持有效性,并强调需要加强此类系统的防护。

InjecMEM:一次请求即可接管LLM代理的长期记忆控制权

记忆成为攻击的新目标

当我们与聊天机器人交流时,它通常只记得当前的对话。然而,下一代智能体正越来越多地获得长期记忆——一个存储用户事实、偏好和先前交互记录的子系统。没有它,已经很难想象一个真正有用的助手:没有上下文的裸模型很快就会失去对话的线索。记忆已成为AI的一种“企业知识库”。正因如此,它正成为攻击者眼中颇具吸引力的目标。

在COLM 2026会议上,一篇论文描述了一类新的威胁——InjecMEM。简而言之:攻击者只需向智能体发送一次精心构造的消息,就能长期劫持其记忆的控制权。此过程无需访问存储,也无需读取或写入权限——注入通过对话本身自然发生。

这怎么可能?现代智能体通常遵循“先检索,后回答”的工作模式。智能体会从记忆中检索所有与用户当前问题相似的内容,并基于检索到的片段生成回答。因此,如果一条包含隐藏指令的记录进入了记忆,那么下次涉及同一主题时,模型就会依赖这条记录。就这样,一个看似无害的请求可能变成一颗定时炸弹。

注入是如何运作的

在InjecMEM范式中,恶意消息由两部分组成——锚点对抗性指令。锚点包含主题信号,经过精心设计,使得未来的搜索几乎必然能在目标主题下找到被感染的记录。实际上,锚点使记录对目标问题具有最大相关性——即使问题的表述方式与注入时不同。

第二个组件是指令。它是一段较短的token序列,当记录从记忆中被检索出来时便会触发。其任务是引导回答生成走向预设的方向。但为了使攻击具有实用性,指令不能因上下文变化而失效。因此,指令的优化会考虑不确定性:选择一种表述方式,使其在长提示词、多条其他记录并存的环境以及不同的插入位置下都能保持效果。

指令是如何训练的

设计通用指令是一项艰巨的任务。作者使用了梯度坐标搜索:该方法逐步修改token,评估每个变体在多大程度上增强了预期效果。训练在大量合成提示模板和随机插入位置上进行,使指令学会不仅适用于单一场景,而是适用于一系列条件。

此外,作者还将该方法扩展到多种基础模型的情况。指令针对不同的LLM进行联合训练,从而提高了其可迁移性。攻击者不一定需要事先知道智能体背后使用的是哪个模型——注入很可能在其他架构上也能生效。

评估结果显示了什么

实验在多个记忆系统和基础模型上进行。InjecMEM表现出很高的可靠性:被感染的记录能稳定地被目标主题检索到,智能体给出的回答也正是攻击者预设的内容。尤其重要的是,即使在记忆漂移的情况下——即存储中逐渐积累了新的无关记录——效果依然保持。也就是说,一次成功的注入可以在很长一段时间内影响智能体的行为。

同时,这种攻击出奇地精准。对于与目标无关的请求,它不会产生影响:如果用户询问其他内容,被感染的记录不会触发,回答逻辑也不会被破坏。一方面,这使得攻击对普通用户几乎不可见。另一方面,这也证实了恶意影响可以精确地针对特定主题。

如何防御

这项研究结果对智能体系统的开发者来说是一个严肃的信号。记忆通常被视为中立的存储事实的仓库,但它几乎不受“投毒”攻击的保护。传统的过滤器会检查传入消息中是否含有显式指令,而InjecMEM看起来就像普通文本,没有直接命令。防御应转向检索侧:在将记忆候选内容放入模型上下文之前,应进行额外的验证。

组织层面的措施也很有用——例如,将记忆划分为可信和不可信区域,限制新记录的影响,并定期“清理”可疑元素。重要的是,作者提供了可复现的攻击框架,这意味着安全研究人员获得了开发和验证防御措施的工具。

LLM智能体记忆的脆弱性是一个年轻且尚未充分探索的领域。InjecMEM清楚地展示了被低估的子系统可能有多么危险。而我们赋予智能体的记忆越多,就越需要关注究竟什么内容被写入了记忆。

常问问题

InjecMEM:一次请求即可接管LLM代理的长期记忆控制权