Co-RL:无标签多智能体学习,模型通过相互评估进行推理

1 九月 20269 视图

研究人员提出了Co-RL方法,该方法让一组独立模型基于彼此的评估进行训练,无需昂贵的标注。该方法提升了文本和多模态任务中的推理质量与训练稳定性,并在多种情况下达到了监督式方法的效果。

Co-RL:无标签多智能体学习,模型通过相互评估进行推理

问题:为什么RL会卡在标签上

强化学习(RL)如今被认为是改进语言模型和视觉-语言模型推理能力的最有前景的方法之一。逻辑很简单:模型尝试不同的策略,因正确行为获得奖励,并逐渐学会更好地推理。但有一个陷阱——要让奖励有意义,通常需要来自外部的精确信号:可验证的答案、标准解答、标注好的推理链。这些数据的准备成本很高,而且对许多任务来说,这类数据正变得越来越稀缺。

部分问题可以通过self-rewarding方法解决,即模型自己评估自己的回答,并在此基础上调整行为。然而,这里出现了一个恶性循环:如果模型已经存在偏差或习惯于次优回答,它就会强化这些同样的错误。基于自身反馈的学习很快就会导致同质化:回答变得彼此相似,多样性下降,最坏的情况下会发生崩溃——模型固守在狭窄的模板集合中,停止进步。

Co-RL是如何运作的

arXiv:2608.17253预印本的作者提出了Co-RL框架,打破了这一恶性循环。Co-RL不是让单一模型基于自己的评估来学习,而是同时训练多个完全解耦的模型——它们不共享公共参数,也不窥探彼此的权重。每个模型获得的奖励不是来自自身,而是来自队列中的其他参与者(peers)。本质上,模型之间相互推理、批评和评估,训练正是基于这些“外部”评估来构建的。

这种反馈交换从根本上改变了动态。不同模型的错误很少完全重合——每个模型都有自己的弱点、自己的思维模式和自己偏见。因此,当一个模型评估另一个模型的回答时,它“确认”对方系统性错误的概率要低得多。这使得系统能够避免自我强化反馈回路——正是这种回路导致self-rewarding方法失效。

多样性作为核心要素

Co-RL的关键思想在于,成功直接取决于队列的多样性。如果所有模型都一样,它们只会互相附和,不会带来任何优势。因此,作者提出了三个层次的异质性:

  • 不同的模型家族——例如,组合不同厂商的架构,使它们不会继承共同的错误。
  • 不同的规模——大型和紧凑型模型看待任务的方式不同,它们的评估相互补充。
  • 改写后的训练样本——相同的示例以不同的表述方式呈现,从而降低由相同任务设定所引发的错误相关性。

这种队列的多样性降低了相关错误——这类错误之所以危险,是因为它们会逐轮累积。同时,行为多样性得以保留——模型不会坍缩为单一的推理风格,而是继续探索不同的路径。

实验显示了什么

作者在文本和多模态任务上验证了Co-RL,将其与基础模型以及无法访问ground-truth标签的label-free方法进行了比较。在LLM的七个文本基准上,平均提升为3.0–8.6%,而在VLM的四个多模态基准上为2.3–7.2%。同时,Co-RL不仅超越了类似的无标签方法,在某些情况下还能与监督学习相媲美甚至更胜一筹——尽管它完全不需要标注数据。

这对行业来说是一个重要信号:未来或许不在于无休止地收集昂贵的标注,而在于合理组织的模型间交互。参与相互评估的智能体越多、它们之间的差异越大,训练就越稳定、质量越高。

实践启示

Co-RL看起来是迈向真正自学习系统的令人信服的一步。它不需要标注,不会在自身反馈上耗尽,同时保持高水平的推理质量。开发者指出,框架代码对社区开放——这意味着今天就可以复现这一方法并根据自己的任务进行调整。

当然,仍有问题存在:例如,如何针对特定任务最优地组建队列,以及同时训练多个模型的成本是否过高。但这一理念本身——让模型不是独自学习,而是在一个相互评估的集体中学习——为研究开辟了一个有趣的方向。或许,正是这样的机制让我们更接近那些能够像人类互相学习经验一样自然地学会推理的系统。

常问问题

Co-RL:无标签多智能体学习,模型通过相互评估进行推理