Anthropic 将委托 Accenture 对 AI 模型风险进行独立审查

29 九月 202610 视图

五年内,这些公司计划投入至少20亿美元,用于评估先进模型,包括红队测试和安全机制验证。Accenture Faculty 的专家将能够访问 Anthropic 的内部流程,以发现漏洞并评估其安全承诺的履行情况。

Anthropic 将委托 Accenture 对 AI 模型风险进行独立审查

投资规模与用途

Anthropic 和 Accenture 计划在五年内投入至少 20 亿美元,用于对前沿 AI 模型进行独立评估、红队测试和安全检查。

两家公司各自计划至少投入 10 亿美元,用于发展 AI 安全测试和监督能力。这些是投资计划,并不代表资金已经支出。

这项倡议的关键指标是最低承诺投资额、五年期限和投资方向。

如何开展独立评估

合作双方选择了嵌入式评估(embedded evaluation)模式:独立评估人员将在 Anthropic 内部工作。他们将获得与员工相当的访问权限。

评估人员可以:

  • 检查公司的运作情况及其是否履行安全承诺;
  • 发现盲点并报告事件;
  • 向公众提供更全面的信息,帮助其了解相关优势和风险。

这类评估的实际标准不仅在于外部评估人员是否参与,还在于他们能否接触公司的实际运作。

Accenture Faculty 的任务

Accenture 专门从事 AI 业务的部门 Faculty 将牵头这一合作项目,负责评估 Anthropic 的模型并对其进行红队测试。

其职责还包括合规评估和模型防护机制测试。这明确了 Accenture Faculty 在合作项目中的具体工作范围。

这一方法为何仍在发展

Anthropic 称,嵌入式评估仍是一个发展中的领域。公司正在与非营利评估组织 METR 及其他组织商讨试点项目。

Anthropic 预计,随着时间推移,更广泛的评估生态系统将形成通用标准。该合作项目的出现,正值监管机构、研究人员和企业日益关注如何保护更强大模型之际。

这里所说的通用标准是预期的发展方向,而非已经实现的成果。

常问问题

Anthropic 将委托 Accenture 对 AI 模型风险进行独立审查