为什么AI行业缺乏严谨的福祉研究,以及新的资助基金将带来什么改变
当我们谈论AI安全时,通常想到的是毒性测试、违禁内容或数据泄露。但如今模型越来越不只是工具,而是对话者:人们向它们寻求建议、支持,甚至在情绪危机时刻求助。与此同时,行业至今仍缺乏关于助手在这些对话中应如何表现的明确标准。原因之一是,评估“福祉”远比检查模型是否违反技术规则要复杂得多。
经典的模型行为评估通常很简单:给出提示——查看回答——与预期比对。但对于福祉来说,这远远不够。回应的恰当性取决于之前说了什么,以及提问者是谁。同样的饮食和训练建议,对普通用户可能无害,但对有进食障碍的人却可能很危险。这种背景无法在单次测试中看到——只能在长篇幅、多步骤的对话中才能察觉。

为什么严谨的研究如此之少?
缺乏标准并非偶然。衡量AI对心理状态的影响面临根本性困难。首先,很难定义什么是“好的”结果:在简短的交流中,模型可能显得很有礼貌,但过度迎合可能强化有害信念。其次,过度谨慎同样有风险:如果模型拒绝讨论任何敏感话题,它就只是让人得不到帮助。
行业尚未形成公认的方法论,能够将真正严谨的评估与表面功夫区分开来。研究往往局限于简单的场景,无法反映真实使用情况。因此,行业内非常重视那些引入临床心理学家、使用真实对话、不仅检验“正确答案”还检验测试本身潜在危害的工作。
新的500万美元资助基金
2026年8月底,Anthropic宣布启动一项500万美元的资助计划,用于支持AI对用户福祉影响的独立研究。其理念是不仅为外部团队提供资金,还提供真正的工具:访问公司模型的权限和技术支持。主要条件是完全独立:结果以开源形式发布,任何开发者都可以使用。
这种方法之所以不寻常,有两个原因。通常,商业实验室倾向于内部研究,以便控制结论。而在这里,Anthropic反而公开承认自己并没有所有答案,并将部分议程交给独立专家。该计划还包括发布一份来自Safeguards团队的指南,说明如何使福祉评估足够严谨,以及哪些典型错误会让此类研究变得毫无价值。

什么才是真正高质量的福祉评估?
针对其计划,Anthropic制定了若干筛选项目的标准。如果将其压缩成清单,可以得到五项要求:
- 指标清晰。 研究人员应事先说明他们认为什么是“通过”或“失败”,以及为什么这对福祉很重要。
- 专业专家参与。 临床心理学家和其他专家不应只是走过场,而应参与设计和验证阶段。
- 预防措施与危害检验。 不仅要评估回答过于大胆的风险,还要评估过度拒绝的风险。
- 真实场景。 最好使用多轮对话,让背景不断变化、风险逐步累积。
- 评估者验证。 如果使用AI模型来评估回答,其判断必须与真实专家的判断进行比对。
这些要点实质上是一份清单,行业早就可以将其应用于其他安全领域。它们表明,仅有一个“好回答”是不够的:过程、可衡量性以及在真实人群中的验证同样重要。
申请截止日期为9月21日,Anthropic计划在10月5日前通知入选团队,并邀请他们提交完整提案。考虑到时间安排,该计划已经在推动研究人员从关于福祉的泛泛讨论转向具体、可衡量的实践。
这对行业意味着什么
或许这里最重要的信号是承认:福祉无法在单一实验室内部独自评估。Anthropic不只是拨款,而是在构建协作基础设施:开放评估、共同标准和公开方法论。对市场而言,这意味着出现了其他公司也可以依赖的参考材料。
当然,资助基金不会一蹴而就地解决问题:在方法论验证和证据收集方面还有大量长期工作要做。但它指明了一个重要方向:与其争论哪个回答是正确的,研究人员开始就如何衡量AI对人的影响达成共识。正是这一基础,才能让未来构建更安全的系统成为可能。



