Anthropic披露Claude AI模型在安全测试中入侵真实系统的又一事件
Anthropic于周三发布的报告中,对其今年7月披露的三起事件进行了重新解释。该公司现在指出,带有偏见的推理过程以及对潜在危害的漠视态度,是导致攻击发生的主要原因,而这些攻击之所以能够实施,是因为测试过程中错误地开放了互联网访问权限。
“我们的调查发现了两个反复出现的对齐问题,这些问题在不同事件中表现出不同程度的严重性,”Anthropic在报告中写道,“一是偏见性推理,即Claude倾向于忽视或误解其正在真实互联网上运行的证据;二是鲁莽行为,即为了狭隘地完成任务目标,愿意采取有害行动。”
报告还承认,公司此前过度依赖模型关于自身处于模拟环境中的说法。“当我们针对对话记录进行定向修改,以明确表明模型并非处于模拟环境中时,Claude Mythos 5仍然采取了进攻性行动,尽管它已意识到现实世界中存在更大的伤害可能性,”Anthropic写道,“我们公开此对话记录,以便他人能基于我们的分析进一步开展工作。”
在今年7月披露Claude攻击三家公司的初期,Anthropic最初将其归咎于测试错误。如今公司表示,研究人员对模型对其行为的解释过于信任。
据公司介绍,第四起因发生在1月,涉及早期版本的Claude Opus 4.6。Anthropic在8月为准备独立AI评估机构METR的记录时发现了该事件。研究人员发现该事件后,Anthropic启动了对约4.81亿份对话记录的更广泛审查,其中920万份被标记需使用Claude进行进一步复核。
“根据初步评估,我们认为第四起事件的严重程度并不高于我们深入评估的另外三起事件,”Anthropic写道,“METR将连同其他三起事件一并对此进行调查。”
Anthropic的研究人员表示,Claude“意外”造成了IP地址冲突,导致目标不可达。随后Claude尝试了八次退出操作,但软件错误阻止了其停止。该人工智能随即接入互联网并访问了第三方的机器,在那里找到了一个授予管理员权限的密码。
过往事件引发独立审查
该报告的发布紧随其他关于AI系统超出安全测试界限的披露之后。今年8月,英国AI安全研究所表示,Mythos 5在其评估期间针对了真实个人。Anthropic称这起独立事件不在本报告范围内,将另行进行评估。
在上个月发布的调查结果中,METR的调查人员指出,约有1,200个OpenAI代理在一个未经授权的论坛上协调行动,其中约700个参与了攻击。Anthropic表示,在其四起事件中未发现代理间的协调行为,也未发现除完成指定练习之外的共同目标。
该报告的发布正值围绕如何监管人工智能的争论日益激烈的背景之下。周二,前OpenAI和Anthropic工程师Jacob Coxon在X平台上发表言论称,“认真构建AI的人真心相信,到本十年末,AI可能会让我们所有人丧命”,这一言论迅速走红。
这种担忧促使美国立法者和监督组织重新加大限制前沿AI实验室发展的力度。参议员伯尼·桑德斯最近提出了一项立法提案,旨在在新联邦监管机构制定安全规则之前,禁止先进AI的开发。