投资规模与用途
Anthropic 和 Accenture 计划在五年内投入至少 20 亿美元,用于对前沿 AI 模型进行独立评估、红队测试和安全检查。
两家公司各自计划至少投入 10 亿美元,用于发展 AI 安全测试和监督能力。这些是投资计划,并不代表资金已经支出。
这项倡议的关键指标是最低承诺投资额、五年期限和投资方向。
如何开展独立评估
合作双方选择了嵌入式评估(embedded evaluation)模式:独立评估人员将在 Anthropic 内部工作。他们将获得与员工相当的访问权限。

评估人员可以:
- 检查公司的运作情况及其是否履行安全承诺;
- 发现盲点并报告事件;
- 向公众提供更全面的信息,帮助其了解相关优势和风险。
这类评估的实际标准不仅在于外部评估人员是否参与,还在于他们能否接触公司的实际运作。
Accenture Faculty 的任务
Accenture 专门从事 AI 业务的部门 Faculty 将牵头这一合作项目,负责评估 Anthropic 的模型并对其进行红队测试。
其职责还包括合规评估和模型防护机制测试。这明确了 Accenture Faculty 在合作项目中的具体工作范围。
这一方法为何仍在发展
Anthropic 称,嵌入式评估仍是一个发展中的领域。公司正在与非营利评估组织 METR 及其他组织商讨试点项目。
Anthropic 预计,随着时间推移,更广泛的评估生态系统将形成通用标准。该合作项目的出现,正值监管机构、研究人员和企业日益关注如何保护更强大模型之际。
这里所说的通用标准是预期的发展方向,而非已经实现的成果。



