Anthropic与埃森哲将各投资至少10亿美元,历时五年共建嵌入式AI评估团队
埃森哲旗下专业AI业务部门Faculty将负责对Anthropic的模型进行独立评估、红队测试(Red-teaming)以及对齐性审查。嵌入式评估人员将获得员工级别的权限,访问Anthropic的内部运营系统,包括在模型训练过程中进行实时监控。
Anthropic本周宣布,通过与埃森哲旗下的专业AI业务部门Faculty合作,组建一支嵌入式评估团队,对Anthropic的前沿AI模型进行独立评估。双方预计在未来五年内投入至少10亿美元,以构建该合作所需的评估能力。
这一举措兑现了Anthropic首席执行官Dario Amodei此前的承诺:即将外部评估人员直接嵌入公司内部,而非仅依赖远距离的外部评估。据Anthropic介绍,嵌入式评估人员将对模型进行评估和红队测试,开展对齐性评估,测试模型的安全防护机制,监控模型训练过程,观察公司的决策流程,验证安全承诺,识别组织盲点,并及时报告突发事故。
这种安排标志着对传统外部AI评估模式的转变。在传统模式下,外部评估人员通常仅在模型完成后,针对既定基准进行测试,无法持续接触公司内部流程。相比之下,嵌入式评估人员将获得员工级别的Anthropic运营访问权限。这一架构旨在让他们能够在模型开发和内部决策阶段发现问题,而不仅仅是在模型定稿并发布之后。
Anthropic表示,此次合作是非排他性的,公司计划继续与其他评估机构合作,包括专注于评估前沿AI系统能力和风险的非营利组织METR。Anthropic对此解释道:“独立的嵌入式评估者并不会降低我们的问责制,而是有助于使问责更加可验证。我们模型的安全责任依然由我们承担。”
两家公司在五年内合计20亿美元的财务承诺表明,Anthropic和埃森哲都将嵌入式评估视为一种持续的运营职能,而非一次性审计。不过,两家公司均未披露评估团队的发现将如何向公众报告,也未说明若评估人员与Anthropic就模型安全性产生分歧时,争议将如何解决。
此次合作正值业界对前沿AI实验室内部安全实践进行严格审视的背景下展开。过去一年中,多家公司的外部研究人员和前员工对重大模型发布前安全测试的严谨性提出了质疑。正如Anthropic所描述的,拥有内部访问权限的嵌入式评估人员,比大多数实验室迄今为止依赖的基于基准的外部审计更具结构性侵入性。其有效性将在未来得到检验,关键在于它能否揭示出纯外部评估流程所遗漏的问题。