本文内容
当大型语言模型解决复杂的逻辑或数学问题时,生成过程不仅仅是简单的逐词输出。每一步都依赖于内部状态,模型在其中保持条件、中间结果以及它们之间的联系。强大的推理型LLM能高效利用这一空间,但即使它们也会出现故障。问题往往不在于知识不足,而在于所需的认知机制——自我检查、重新表述问题、回溯先前的结论——未能及时启动。
一项新研究的第一版于2026年5月出现在arXiv上,最终版于8月发布,并被EMNLP 2026会议接收。作者提出了潜在奖励引导(Latent Reward Steering, LRS)框架。这是一种自适应的推理时方法:它不改变提示文本,也不添加指令,而是作用于模型的内部表示。本质上,系统学会在发现推理偏离方向时“修复”推理过程。
为什么行为提示不够
改善LLM推理最常见的方法是明确要求它按特定方式行事:“把任务分解成步骤”、“检查自己”、“先思考再回答”。这类技巧在外部文本层面管理行为。它们假设存在一个对所有错误同样适用的通用脚本。但实际上,故障类型千差万别:模型可能误解条件、丢失重要细节、选择不合适的方法,或在最后一步计算出错。
同时,不同模型——甚至同一模型在不同尝试中——出错方式也不同。预设的提示既不考虑任务类型,也不考虑当前推理状态,更不考虑具体LLM的特性。在某些情况下它有帮助,在其他情况下则毫无用处,有时甚至有害,因为它迫使模型机械地遵循模板,而不是适应真实的思维过程。

LRS如何修正推理过程
LRS不是给模型文本建议,而是在模型推理过程中产生的隐藏状态层面工作。这些状态不仅包含步骤内容,还带有模型朝答案前进时自信程度的细微信号。为了让这些信号可用于控制,使用了稀疏自编码器。
SAE将模型的密集激活分解为少量可解释的组件。其中部分组件对应有用的认知行为,如中间检查或结论复核。LRS的干预正是针对这些组件。这种方法能比文字指令更精确地影响模型的“思考”。
训练潜在奖励模型
为了区分成功的内部状态与失败的状态,作者训练了一个单独的奖励模型。它输入的不是最终答案,而是中间潜在状态,并评估它们使模型接近正确结果的程度。训练数据使用按答案正确性标注的完整推理轨迹。这样,奖励模型学会提前预测当前路径段是否会通向成功。
通过奖励梯度进行修正
当LRS在生成过程中发现看似前景不佳的状态时,它会计算该状态各组件上奖励信号的梯度。梯度指示了移动潜在状态的方向,以增加正确延续的概率。LRS的关键特点在于,这个方向不是预先设定的,也不是从固定的“良好推理规则”中推导出来的。它是针对每个具体状态实时计算的,因此该方法能适应模型、任务以及当前错误的特性。
奖励与置信度门控
每一步都干预风险太大:持续的外部影响可能破坏自然生成。因此,LRS使用奖励与置信度门控。它只对奖励信号标记为脆弱的状态进行修正。如果当前状态被评估为自信,则不进行干预。这种选择性方法减少了副作用,并在模型本身表现良好时保持推理的自然性。

实验显示了什么
作者在多个作为基础的推理型LLM以及一组标准基准上验证了LRS。该方法与各种基线方法进行了比较,在大多数配置中,LRS都带来了稳定的精度提升。重要的是,积极效果并非个例:在更换模型和任务类型时都能复现。
对结果的后续分析表明,改进不能归结为简单的“延长”回答或改变生成风格。研究人员发现:LRS隐式地促进了那些通常通过文本提示试图引发的认知行为。模型更频繁地回退到错误的中间结论,更仔细地分析条件,并表现出更连贯的推理过程。也就是说,该方法确实通过内部状态起作用,而不是通过外部模板。
为什么这很重要
LRS之所以引人注目,不仅在于具体结果,还在于它改变了推理控制的基本原则。研究人员不是寻找完美的提示措辞,而是提议学会在模型自身表示的空间中小心地“纠正”它。这种方法潜在地更具通用性:它不需要预先描述所有可能的认知场景,而是自行发现当前哪个思维方面需要修正。
目前,LRS是一个研究框架,而非现成产品。作者开放了代码,以便其他团队复现实验并根据自身任务调整方法。但方向已经明确:LLM推理的控制正逐渐从词语层面转向隐藏机制层面——这些机制决定了模型究竟如何思考,而不仅仅是它说了什么。




