同时处理图像和文本的模型已经学得相当出色:它们能识别物体、回答关于图片的问题,并将知识迁移到新任务上。然而,在这成功的背后,往往隐藏着一个不明显的弱点:模型记住的并不是物体的真实属性,而是那些充当“捷径”的伴随细节。对抗性提示调优是让模型更稳健的方法之一,但它也有陷阱。我们来分析一下,为什么模型学错了东西,以及新方法如何提出区分有用特征与误导特征。
为什么模型学错了东西
当视觉-语言模型在带有噪声或对抗样本的数据上进行微调时,期望稳健性会均匀提升似乎是合乎逻辑的。但实际情况恰恰相反:在已见过的类别上,模型表现出色;而在面对对抗攻击时,新类别的质量会急剧下降。这种现象被称为稳健泛化的过拟合。
原因在于,模型开始依赖伪稳健特征——那些能在攻击中幸存下来、但并不反映物体本质的随机规律集合。例如,模型可能记住了训练样本中的背景纹理、典型阴影或特定噪声。这些特征能通过对抗扰动的检验,但在新数据上却不起作用。模型过拟合的不是内容,而是捷径提示——而且训练时间越长,未见类别上的退化就越严重。

如何区分特征:ADAPT 的思路
作者们从一种不同寻常的理念出发:与其只教模型学习正确的特征,不如还明确地教它不该学什么。由此诞生了 ADAPT(Adversarial Disentangled Prompt Tuning,对抗解耦提示调优)方法。
关键思想是同时使用两类提示:
- 目标提示——负责让模型提取稳健、可泛化的特征。
- 诱饵提示——一组额外的提示池,故意“吸收”伪稳健规律。
在训练过程中,诱饵提示之间相互竞争:每个都试图捕获特定类型的随机捷径。而目标提示被强制在嵌入空间中与诱饵保持正交。这样一来,稳健特征就与误导特征分离开来:诱饵已经“学会”的东西,目标提示无法再使用。
双提示的机制
在实践中,这看起来像是分工。诱饵提示并不用于最终预测——它们的任务是充当继承性偏差的“垃圾桶”。而目标提示则在约束条件下训练:它的向量不能与诱饵的方向重合。嵌入空间中的正交性意味着,诱饵所使用的特征不会影响目标提示的决策。结果,模型被迫寻找更深层、更因果性的规律。

为什么分离有效
正交性不仅仅是一种技术手段,更是提供理论保证的方式。方法分析表明:特殊的损失函数限制了伪稳健特征偏移对未见类别预测的影响。
简而言之:即使诱饵收集了大量多余信息,这些信息也无法“流入”目标提示。因此,从已见类别过渡到未见类别时发生的数据分布偏移,对模型误差的影响更小。这种方法在对抗样本上带来更可预测的行为,并且不会牺牲某一类的稳健性来换取另一类。
实验显示了什么
实际测试证实:与现有的对抗调优方法相比,ADAPT 显著提升了目标提示在未见类别上的稳健性。模型不仅仅是记住了针对特定攻击的防御,而是形成了更干净的特征,这些特征在新材料上依然有效。
当然,目前还无法完全消除虚假模式——区分因果与相关性的任务仍然是机器学习中最困难的挑战之一。但“教模型不该学什么”的方法提供了一个实用的方向:有时教模型最好的方式,是让它知道该忽略什么。
给实践者的核心结论:在调优视觉-语言模型时,不仅要关注训练数据上准确率的提升,还要关注模型依赖的是哪些特征。如果在训练过程中加入针对随机规律的“陷阱”——例如通过带正交性的双提示——你不仅能得到更可靠的模型,还能得到一个更诚实的模型。



