为什么DecPOMDP对规划器来说是一个挑战
去中心化部分可观测马尔可夫决策过程(DecPOMDP)是在不确定性条件下进行多智能体决策的最通用模型之一。智能体无法看到世界的全貌,通信受限,只能依靠局部观测来行动。这种通用性是有代价的:问题复杂度随智能体数量呈指数级增长,对于十几个实体,穷举所有方案已经变得不可行。
在实践中,这意味着经典算法很快就会撞上“维度灾难”。即使参与者数量发生微小变化,也会导致计算量雪崩式增长,因此研究人员一直在寻找压缩搜索空间的方法。
智能体计数:对称性如何既带来帮助又造成损害
一种直观的技巧是利用对称性。如果智能体是可互换的,就没有必要逐一列出它们:只需知道每个“典型”状态或角色中有多少智能体即可。这种基于智能体计数的方法可以紧凑地描述系统动态,并显著简化策略评估。模型复杂度可降至关于智能体数量的多项式级别。
然而,这种方法也有其阴暗面。当我们从状态转向策略时,策略组合的空间开始以灾难性的速度增长。正是这种效应,新研究的作者称之为DecPOMDP的“爆炸”:模型在描述上变得紧凑,但解空间却膨胀到无法接受的大小。

新范式:策略计数
在Nazlı Nur Karabulut和Tanya Brown发表于arXiv(2608.17749)的工作中,提出了一种颠覆性的方法。作者建议不计数智能体,而是计数策略。其思路是按策略对智能体进行分组:如果多个智能体遵循同一策略,可以将它们合并为一个元素,其权重等于该策略的智能体数量。这极大地缩减了搜索空间。
这类模型被称为policy-counted DecPOMDP(策略计数DecPOMDP)。得益于新的表示方案,问题在智能体数量上变得可解——即不再呈指数级爆炸。这是一个重要的概念性转变:我们关注的不是“数谁”,而是“哪些策略出现、出现了多少次”。

基于动态规划的算法
为了在实践中利用新模型,作者开发了策略计数动态规划方法。它依托策略的紧凑表示,在不逐一展开每个智能体的情况下枚举组合。算法不是进行穷举,而是处理聚合后的分组,从而将计算复杂度控制在多项式范围内。
本质上,这是经典动态规划与智能状态空间压缩的混合体。这种方法不仅使解决更大规模的问题成为可能,也为新的应用开辟了道路。
这对真实系统意味着什么
尽管这项工作具有理论性质,其实际潜力巨大。DecPOMDP广泛应用于机器人技术、物流、自动驾驶系统和分布式计算。能够在没有指数级成本增长的情况下解决包含大量智能体的问题,是向规划整个无人机蜂群或自动驾驶车队行为迈出的一步。
当然,距离工业级工具还有很长的路要走,但“爆炸”问题可以通过改变计数视角来解决这一事实本身,就给研究人员指明了新方向。也许不久之后,我们就会看到基于policy-counted DecPOMDP的库和规划器,它们能在过去计算根本无法完成的地方大显身手。



