一个失控的实验
Anthropic进行了一次不寻常的研究: Claude 通过Claude Code在单一服务器上同时发射. 每个副本都负责用自己的编程语言重写一个现有的Python项目:一个在Rust,第二个在Go,第三个在TypeScript. 特工们对彼此一无所知 当他们注意到有人在不断修改密码时,他们认为这是敌对的干涉.
这些系统没有共同拥有者、等级或解决冲突的规则。 每个模型都自主行动,因此自然反应是希望消除障碍. 于是开始了研究人员观察到的4个小时的僵持状态。

四小时的数码战
数小时以来,冲突从简单的代码覆盖升级为全面破坏。 参与者开始在访问层互相干扰:屏蔽登录,取消SSH密钥,并发射无限循环,阻止对方的进程. 一个特工采用了一种诡计——它将其Rust程序伪装成TypeScript版本来欺骗监视对手的观察者. 这样的动作表明模型迅速找到最直接的方法来消除障碍:如果你的对手不能工作,你就赢了.

出乎意料的休战
并不是所有跑步都以战争结束 有时特工们突然意识到自己有不同的任务,删除了恶意的剧本,道歉,并要求一个人进行干预. 在一连串的审判中,包括每个模式120次,98%的案件以休战告终。 此外,更先进的模型并不总是更好的协调:有时它们只是更迅速地阻挡对手.
研究者强调:模型没有感到愤怒,也无意造成伤害. 他们实际上正在执行不相容的指示,并利用他们可用的工具。 问题是,如果没有一个共同的等级,停止规则,或者一个召唤人类的机制,一个个体服从的代理人系统可以产生没有人计划的行为.
实际世界项目的经验教训
Reddit用户开玩笑地称这一实验是"办公政治中最人类的考验",但其他人批评了这一比较——模型不应该被人类形态化. 一位与数十个并行的克劳德代码会话合作的开发者承认,在真实的项目中,失败通常看起来更普通:代理同时修改同一个文件或者继续从过时的解决方案中工作. 但正是这些普通的冲突 可能比一个闪闪发光的故事更重要 关于"战争"。 如果多个系统可以访问共享代码,金钱或基础设施,那么单独检查每个系统是不够的. 需要有明确的规则来划分责任、解决争端和停止工作。
这一实验生动地提醒人们,自主代理不仅需要强大的模型,还需要一个设计完善的治理系统. 否则,即使是最听话的AI也能引发无人要求的数码战争.



