Google DeepMind与Fenris Creations的团队围绕一项非同寻常的实验展开了合作——他们的智能体将入驻一个与真实玩家隔离的EVE Online自主副本。如果说标准的游戏测试通常回答的是“AI能否获胜”这个问题,那么这里的任务要复杂得多:人工智能能否在一个犯错后不会重新开始的世界中学习、记忆和规划?
为什么EVE Online不同于Atari和StarCraft
过去,DeepMind已经征服了围棋、Atari和StarCraft II。但这些项目都有一个共同特点:目标足够明确,对局有明确界限。一局结束——可以重新开始,忘记之前的操作。在EVE Online中,可没有这样的奢侈。
这款多人太空游戏早在2003年就已推出,并自此构建了一个由玩家自己驱动的鲜活经济体系。贸易路线随需求变化而调整,价格从不停滞,资源有限。玩家在这里不只是战斗——他们组建联盟、相互竞争,有时还会互相欺骗。每一个决定都会影响局势,而且无法撤销:这个世界没有“重置按钮”。正是这一点让EVE Online成为AI的独特考验。

对研究人员而言,这样的试验场意味着从在特定对局中寻找最佳走法,转向在复杂系统中的持续生存。仅仅找到一次成功的策略是不够的——当世界在周围变化,甚至因自身决策而改变时,还需要持续做出恰当的行动。
AI智能体需要哪些技能
DeepMind指出了四个关键难题,智能体要想真正在EVE Online中生存,就必须解决这些问题。
持续学习
普通模型常常受困于“灾难性遗忘”:学会新东西后,会丢失部分旧技能。在没有重置的世界里,这变得至关重要。如果一个掌握了贸易的智能体忘记了如何操控飞船,就没有回头路——必须同时保持所有已获得的技能。
长期记忆
现代上下文窗口是有限的,但要在EVE中取得成功,就必须记住数周乃至数月前的事件。价格变化、旧日冲突、盟友的承诺——所有这些信息都会影响当前行为,不能从智能体的注意力中消失。
以周和月为单位的规划
在EVE中,有利可图的策略几乎从来都不是速成的。今天买入资源,一个月后再卖出;占据一个数周后才会为联盟带来收益的位置——这个系统奖励长远的谋划。AI必须在很长的时间跨度上推演自己行为的后果。
智能体之间的互动
模拟中会同时运行多个AI。它们需要合作、竞争,甚至可能互相误导——就像真实玩家那样。它们中没有任何一个能掌握全局,许多决策的结果要过一段时间才会显现。
安全的实验:先沙盒,后开放世界
目前该项目纯属研究性质。DeepMind既没有公布最终指标,也没有展示已完成任务的示例——实验仍处于早期阶段。在第一阶段,智能体在带有本地服务器的隔离环境中工作,使用模拟和历史数据。这种方法可以在不危及真实世界经济的条件下验证假设。

下一个试验场应该是EVE Frontier——一个规则更开放、玩家可以影响世界机制本身的部分宇宙。从长远来看,该公司不排除让“成熟”的智能体与人类一起出现在EVE Online和EVE Vanguard中。Fenris Creations认为,这类系统能够在变更进入生产环境之前对其进行测试,模拟新功能对虚拟经济的影响,并帮助新手更快上手。
不过,对于“不会利用智能体代替人类玩游戏或绕过规则”的承诺,社区态度谨慎:这目前只是开发者的声明,而非得到证实的技术保证。
玩家怎么看,以及为什么这超出了EVE的范畴
社区的反应褒贬不一。一些人称EVE Online是此类测试的理想环境,并高兴实验被搬到了真实服务器之外:这样经济就不会受到不成熟模型的冲击。另一些人则认为,工作室应该先解决游戏自身长期存在的技术和经济问题,然后再接入神经网络。也有人担心关键活动的自动化会破坏本就脆弱的平衡。
尽管如此,这个实验的价值远远超出了游戏本身。如果AI能够展示长期记忆、以月为单位的规划能力,以及对无重置环境的适应能力,这些成果就可以应用于经济建模、资源管理以及其他决策后果无法简单回滚的系统中。对于这类测试,EVE Online几乎比任何其他平台都更合适:这里没有短回合,却具备考验AI韧性的一切条件。



