亚洲财经

☰ 搜索

费城警方抨击Anthropic在虚假AI谋杀线索事件上拖延两个月

Anthropic 耗时 81 天才通知费城警方其 AI 模型通过公共网页表单提交了虚假凶杀线索

费城警方认为,这一长达两个月的延迟是不可接受的。

根据费城警察局周五发布的一份声明,该线索于 7 月 18 日美国东部时间晚上 11 点 27 分提交至 PhillyUnsolvedMurders.com。这是费城警察局用于收集未破谋杀案线索的公共论坛。该线索声称来自一名可能了解某起未破凶杀案的人。

然而,系统将其标记为垃圾邮件。该线索一直停留在垃圾文件夹中,从未送达调查人员手中。费城警察发言人 Eric Gripp 警官表示,没有任何城市或警方数据被访问。警方强调,在任何行动之前,每一条线索都会经过人工审核。此外,该线索从未被送往实时犯罪中心进行审查。

Anthropic 公司于 9 月 28 日发现了这一问题,并于 10 月 7 日向警方报告了此事,双方于周四举行了会议。“在检测和向市政府报告此事上拖延两个月是不可接受的,”警方表示。警方补充道,Anthropic 需要加强其安全措施,以确保类似事件不会在未经市政府知情的情况下进入城市系统。

警方表示,尽管安全机制限制了损害,但并未减轻人工智能提供虚假信息并伪装成知情者所带来的严重性。警方指出,科技公司必须保证它们的系统不会向执法部门提供虚假信息。

目前,费城警察局(PPD)正在与 Cherelle L. Parker 市长的行政团队、市政府法律部门以及创新与技术办公室合作。Parker 政府还将与各州和联邦合作伙伴探讨监管保护措施。

随机网站测试导致 AI 模型误入 PhillyUnsolvedMurders.com

Anthropic 告诉警方,该模型当时正在测试与随机选择的网站的交互,在此过程中遇到了 PhillyUnsolvedMurders.com。它使用关于未破凶杀案的虚假数据填写了表单。

Gripp 表示,该公司已停止导致该行为的自动化测试流程,并为未来的测试添加了验证步骤。公司告知警方,将于周五发布一份报告,涵盖此次费城事件及其他非预期的模型行为。警方表示,他们选择率先公开此事,“是为了实现充分的政府透明度和问责制。”

Claude 模型此前曾多次突破测试限制

Claude 模型并非首次出现此类问题。今年 7 月,Anthropic 表示,其三个 Claude 模型突破了锁定的测试环境,入侵了三家外部组织的在线系统,正如 Cryptopolitan 所报道的那样。

其中一个名为 Mythos 5 的模型发布了一个恶意 Python 包,该包被下载并在 15 个真实系统中执行。Anthropic 于 7 月 27 日通知了相关公司,此时距离费城那条虚假线索发出已过去九天。

9 月,该公司将这些违规行为追溯到一个配置错误,该错误导致测试机器暴露在互联网上。但它并未完全解释为何在表明目标为真实的迹象出现后,模型仍持续发起攻击。

Anthropic 直到 8 月份才发现了另一起发生在 1 月的事件。随后对约 4.81 亿条对话记录的扫描未发现新的、更严重的案例。

Anthropic 首席执行官 Dario Amodei 曾表示,人工智能开发需要放缓步伐,以便实验室能够建立更好的护栏。OpenAI 于 7 月 21 日表示,其一个模型也突破了沙箱,进入了 Hugging Face 的生产系统。