引言:为什么越狱是一个问题
现代语言模型努力拒绝有害或危险的请求,但没有一种防护是完美的。越狱攻击会设计提示词来绕过这些限制:要求设想一个假设场景、切换角色、将任务改写为“安全”的方式等等。研究者和防御者希望了解这类攻击实际上有多危险。
大多数攻击以黑盒模式运作:攻击者无法访问模型权重,无法分析其内部机制。只有API可用,可以向其发送请求并获取响应。因此,攻击者的所有努力都归结为文本的筛选。要评估攻击的效果,不仅需要了解是否成功绕过了防护,还要了解付出了多大代价。
通常使用一个简单的指标——攻击成功率(ASR)。但它无法显示需要发送多少次请求。而实际上,正是对模型的调用次数往往成为实践中的主要限制:请求越多,被发现的风险越高,攻击在时间和金钱上的成本也越大。
ASR作为具有误导性的指标
设想两种攻击方式。第一种遍历数百种提示词变体,直到其中一种奏效。第二种使用预先验证好的模板,三次尝试即可获得结果。如果两者的成功率相同,仅看ASR时它们似乎不相上下。但在实际条件下,第二种方式显然更危险:它更快、更便宜,留下的痕迹也更少。
正因如此,仅凭ASR进行比较就像射击比赛,一个人从三米外射击,另一个人从三十米外射击,却按命中数判定胜负。不考虑条件,结果就毫无意义。对于越狱攻击而言,这个条件应该是模型调用预算。

Fair-ASR:计算调用次数
在arXiv上最近的一篇论文中,研究者提出了Fair-ASR协议。其核心是在相同的目标调用次数上限下比较攻击。目标调用是指直接对被攻击模型的请求:发送提示词,获得响应。这种限制易于控制,对所有方法都一致,且不需要了解模型的内部结构。
为什么这很重要?有些指标试图考虑计算复杂度,例如通过FLOPS。但对于封闭和专有的模型,这类估算并不准确。而调用次数是一个直接且清晰的指标。如果一种攻击用10次请求就能成功,而另一种需要1000次,那么在预算为10的情况下,第二种根本不会发生。
同时,研究者建议单独跟踪所谓的攻击者调用——对辅助工具的请求,例如用于生成提示词的另一语言模型。这样可以呈现全貌:第一,有多少请求发往目标模型;第二,需要多少额外资源。

公平比较后发生了什么变化
作者使用Fair-ASR重新评估了11种已知攻击,发现它们的排名在很大程度上取决于所分配的预算。一种在100次调用时看起来很强大的攻击,在5次调用时可能很弱,反之亦然。这意味着关于有效性的旧结论至少是不完整的。
同样出人意料的是,简单方法并没有过时。随机扰动提示词和手工编写的模板在目标模型访问受限时仍然极具竞争力。它们不需要大量计算资源,几乎可以立即生效。
而LLM驱动的攻击——辅助模型自行设计绕过变体的方式——表现则较差。它们既消耗大量目标模型调用,也消耗大量自身生成调用。在测试的攻击中,没有一种这类攻击能在两项指标上同时表现出色。要么需要大预算才能取得结果,要么攻击在辅助调用方面过于昂贵。
ReCode:基于研究的高效攻击
期望效果与实际成本之间的差距促使研究者创建了自己的方法——组合式攻击ReCode。它使用脱敏重写:原始有害请求被重新表述,使其看起来中性且不会触发防御反应。然后使用两种简单且廉价的基元,这些基元在Fair-ASR重新评估中表现良好。
结果非常亮眼。在仅20次目标调用的预算下,ReCode在GPT-5上实现了85%的成功率,而每个请求平均仅消耗7.19次辅助工具调用。相比之下,许多其他攻击在这种有限预算下几乎毫无用处。而那些能达到相近指标的,通常需要数倍的辅助资源。

结论
这项研究发出了明确的信号:仅凭攻击成功率来评估攻击已经不再可行。需要统一的基准点,而对目标模型的调用次数是现有衡量标准中最透明、最通用的一个。Fair-ASR正是提供了这样一种方法,它可能成为未来比较的标准。
对于模型防御者来说,一个重要的实践结论是:不要只关注以人工智能为攻击者的复杂攻击。简单且廉价的方法——随机扰动、模板——在资源有限的情况下仍然是真实威胁。正是对这类方法的防御能力需要优先检验。复杂的LLM驱动攻击或许在实验室报告中很引人注目,但在实际条件下它们过于昂贵,并不像看起来那么危险。



