谨慎随经验而变:RATTL方法在未知条件下做出安全决策

28 八月 202615 视图

在新工作中提出的RATTL算法,通过智能体对环境模型的当前不确定性来确定风险水平:数据越少,行为越谨慎,随着置信度的提升,策略逐渐变得更加大胆。这种方法在防范最坏情况与追求最大奖励之间提供了折中的保障。

谨慎随经验而变:RATTL方法在未知条件下做出安全决策

随经验而变的谨慎:RATTL方法——在未知条件下做出安全决策

当智能体在现实世界中行动时,几乎总会面临关于环境运作方式的不完整信息。对于必须实时运行的系统——机器人、自动驾驶车辆或基于大语言模型的服务——这一问题尤为突出。过度谨慎以覆盖所有可想象的情景是不可能的,而过于大胆的行为则可能导致事故。我们需要一种平衡,而Deep Kumar Ganguly和Jan Kretinsky的研究提出的新方法正是试图找到这种平衡。

问题的由来

作者发表了论文《Quantifying Risk Under Evolving Uncertainty: Belief-Dependent Robustness for Safe Sequential Decision Making》(arXiv:2608.17574)。该论文于2026年8月提交,并被IJCAI-ECAI 2026会议的RobustifAI研讨会接收。核心关注点是RATTL,即风险对抗性总奖励学习(Risk-Adversarial Total-Reward Learning)。这种方法使智能体能够在环境动态仅部分已知的条件下评估风险并做出决策。

RATTL的关键思想在于,谨慎程度并非固定不变,而是直接取决于智能体对其环境实际的不确定程度。如果证据很少——我们就谨慎行动。当证据增多——我们就可以允许自己采取更大胆的行动。正是这种适应性将本方法与传统方法区分开来,传统方法中风险水平是预先设定并保持不变的。

方法原理:不确定性作为半径

RATTL的基础是对未知环境动态的贝叶斯后验。简而言之,智能体随着观测的积累不断更新其对世界运作方式的认识。但仅凭这一点不足以进行规划:还需要理解这些认识可能在多大程度上存在偏差。

作者的解决方案是将所有可能的环境模型视为一个所谓的Wasserstein不确定性集合。该集合的半径——即我们允许偏离当前预期的程度的度量——被定义为后验的单调函数。在早期阶段,当数据较少时,半径很大:智能体假设环境可能以几乎任何方式运行。随着证据的积累,半径收缩,“可能世界”的范围也随之收窄。

这一机制产生了有趣的插值效应。在极限情况下,当半径最大时,智能体的行为等价于最坏情况保证的鲁棒性——即在最不利情景下也安全的策略。当半径趋近于零时,智能体转变为风险中性的优化器,仅最大化期望总奖励。在中间点,我们得到从极度保守到几乎过度自信的连续行为谱系。

构建这一准则依赖于熵风险价值(Entropic Value-at-Risk)背后的对偶性。这种联系使得风险水平的选择可以转化为不确定性半径的选择,这在计算上很方便,在概念上也很清晰:我们处理的不是抽象的“谨慎系数”,而是一个可以解释为对已知模型允许偏差的几何量。

保证与安全:“安全三明治”

作者并未止步于启发式方法。他们证明了RATTL中的规划问题在状态空间的暂态性和紧致性条件下是良定义的。这意味着算法不会在无限轨迹上“崩溃”,并能给出有意义的价值函数。

核心理论结果被称为Safety Sandwich——“安全三明治”。RATTL的值始终位于两个极值之间。下界由无信息鲁棒值限定——即一个完全没有数据、对最坏情况有所准备的智能体所得到的估计。上界则是完全了解动态时的最优值。随着后验围绕真实模型集中,这两个边界之间的差距缩小,RATTL的估计趋近于最优值。换句话说,该方法保证了初始阶段的过度谨慎不会导致灾难性的低奖励,而最终阶段的自信也不会使智能体对残余风险视而不见。

示例中的行为:从抽象到实践

为了说明,作者考察了一个带有二元危险性的经典示例——环境中存在两种状态,一种安全,另一种致命危险。在这种情况下,RATTL诱导的准则简化为条件风险价值(Conditional Value-at-Risk),其水平由后验熵决定。换言之,智能体信念分布越“弥散”,它选择的损失阈值就越严格。

另一个工作示例展示了有趣的行为:智能体长期推迟有效行动,等待达到一个尖锐的识别阈值。也就是说,它愿意忍受次优性——例如缓慢移动或选择明知不是最有利的策略——只为了不盲目冒险。一旦证据变得足够有说服力,就会发生质变:智能体切换到自信的行动。这类似于人在陌生地方的行为:先缓慢行走并四处张望,认路后便加快速度。

这种工作模式对实时系统尤为重要。作者强调,RATTL旨在保障在持续数据流条件下运行的智能体的安全,包括基于大语言模型的系统。对这些系统而言,不确定性不仅来自物理环境,还来自用户行为的不确定性或所处理文本的质量。

为什么这很重要

RATTL的主要贡献在于摒弃了“谨慎与效率”的二元对立。相反,作者提出将它们视为同一过程的两个方面:我们了解得越多,就越能大胆行动,同时我们希望保持知识程度与可接受风险之间的明确联系。这种方法使自动决策更加透明和可预测,这对实际部署至关重要。

在大状态空间下的计算复杂度问题仍然悬而未决,但理论基础已经奠定。也许在不久的将来,我们会看到RATTL针对特定领域的改进版本——从无人机控制到基于AI的助手,它们从自身经验中学习,同时不危及自身或周围环境。

常问问题

谨慎随经验而变:RATTL方法在未知条件下做出安全决策