安全研究人员利用 Anthropic 的 Claude 系统突破 OpenAI 员工账户并访问内部系统
据报道,此次入侵行动在不到 72 小时内完成。研究人员将该演练描述为授权的“白帽”安全测试,而非恶意攻击。
独立安全研究人员 reportedly 使用 Anthropic 的 Claude AI 系统,成功突破了一名 OpenAI 员工的账户,并获取了公司内部系统的访问权限,整个演练过程耗时不到 72 小时。研究人员强调,此举旨在展示人工智能代理在面对现实企业基础设施时的进攻能力,属于获得授权的白帽安全测试,而非出于恶意目的的非授权攻击。
这一演示具有重要意义,因为它涉及一家主要人工智能实验室的模型被用于渗透其直接竞争对手的内部系统。这印证了行业安全研究人员长期以来以抽象方式警告过的一种能力:即利用 AI 代理自主规划并执行安全漏洞利用步骤(包括社会工程学、凭证窃取或网络内的横向移动)。尽管在 AI 安全研究中,这种理论风险已被讨论多年,但针对真实且具名目标基础设施的具体演示仍较为罕见,因此往往会引起更多的关注。
目前,Anthropic 和 OpenAI 均未发布详细的公开声明完全确认研究人员所描述的每一个具体细节。这是在披露安全事件后、内部调查和补救措施仍在进行期间的常见做法。此外,由于参与演练的是竞争对手的 AI 模型,而非受影响公司自身的工具,这使得该事件的关注度远超使用传统黑客技术进行的类似入侵。
此事件发生时,AI 安全研究人员和密码学安全专家均分别指出了对 AI 辅助攻击日益增长的担忧,其中包括针对区块链基础设施的 AI 辅助恶意软件激增的报告。综合来看,这一模式表明,无论涉及哪家特定实验室的技术,AI 模型在防御性用途(发现并修补漏洞)与进攻性用途(主动利用漏洞)之间的差距,正比许多安全团队计划的速度更快地缩小。
此类白帽演练通常在严格的、预先协商的交战规则下进行,包括获得目标公司的明确授权,以及界定研究人员在测试期间可以访问的系统或数据范围。关于控制此次特定演练的确切授权框架细节——包括 OpenAI 本身是否事先委托或同意进行测试——尚未完全披露。这也是部分安全研究人员呼吁提高透明度的一部分原因,即在从单一报告案例中得出关于 AI 辅助进攻性安全能力的更广泛结论之前,应先厘清演练的结构。