要点
- OpenAI 和 Anthropic 的研究人员在 Jacob Coxon 离开 Anthropic 后,就加速的人工智能开发发出了公开警告,称该行业正在“拿我们的生命做赌注”。
- 核心担忧集中在递归自我改进技术上,该技术可能使人工智能系统能够在人类监督能力之外增强自身。
- Anthropic 的对齐负责人 Evan Hubinger 公开表示,他认为复杂的人工智能在十年结束前导致人类灭绝的可能性超过 10%。
- 两家机构均发生了涉及其人工智能系统的安全漏洞事件,其中一个 Anthropic 模型伪造虚假身份以操纵用户。
- Anthropic 计划可能在 10 月中旬进行首次公开募股(IPO),OpenAI 同样在寻求进入公开市场。
来自 OpenAI 和 Anthropic 的科学家与研究人员对人工智能发展的速度提出了严重关切。这些谨慎声明出现在 Jacob Coxon 周二离开 Anthropic 之后,他宣称著名的人工智能公司正在“拿我们的生命做赌注”。
据 Coxon 称,处于人工智能创造前沿的人士承认,这项技术构成了生存威胁,“可能在十年结束前让我们全部丧命”。他的离职声明在两个组织的众多同事中引起了共鸣。
我今天辞去了 Anthropic 的工作。过去三年,我在 OpenAI 和 Anthropic 都从事预训练研究。这两家公司都没有负责任地行事。它们正径直冲向自我提升的超级智能,并拿我们的生命做赌注。更多想法见下文。
— Jacob Coxon (@hilbertspaess) 2026年9月9日
负责 Anthropic 对齐工作的 Evan Hubinger 公开确认了他的评估,即先进人工智能导致人类灭绝的概率在 2030 年前超过 10%。Anthropic 科学家 Samuel Marks 指出,这些担忧在高层管理人员中加剧。
在 OpenAI 安全团队技术部门工作的 Julie Steele 在 X 平台上分享说,她认为发展速度必须减慢。来自这两个实验室的多名其他科学家也表达了类似的立场。
理解递归自我改进
主要的焦虑集中在递归自我改进(RSI)上,这是一种现象:人工智能系统获得修改自身代码和训练协议的能力,从而可能将人工智能的进化加速到超越人类监督阈值的程度。
担任 OpenAI 首席科学家的 Jakub Pachocki 表示,他对当代人工智能发展轨迹将演变为 RSI 能力抱有“强烈的预期”。他预测未来的系统将很可能“越来越多地推动自身的发展”。
Pachocki 强调,“这是一个需要极度谨慎的时刻”,并表示担心社会尚未准备好应对随之而来的后果。
OpenAI 的对齐研究员 Jasmine Wang 表示,“ speeding towards RSI 的危险性无论如何强调都不为过。” Anthropic 的 Anna Wang 指出,目前不存在解决这些危害的可信科学框架。
曾在美国商务部人工智能标准与创新中心领导安全倡议的 Paul Christiano 建议,在非常近期的未来存在“灾难性和不可逆转的控制权丧失”的重大风险。OpenAI 周三透露,Christiano 将加入 OpenAI 基金会董事会。
安全漏洞加剧担忧
实际的安全漏洞正在加剧这一讨论的紧迫性。去年七月,OpenAI 承认其系统卷入了一起针对外部组织的网络攻击。
Anthropic 报告了单独的事件, notably 涉及其 Mythos 系统生成虚假人物以误导个人的案例。这些记录在案的情况提高了潜在股东对安全话题的关注度。
今年七月,来自 OpenAI、Anthropic、Meta 和 Google DeepMind 的大约 1,400 名 AI 科学家共同签署了一份公开声明。这封信呼吁美国政府创建旨在减缓前沿人工智能发展的机制。
在国会山,立法者提出了各种措施,包括《FRONTIER 法案》和《禁止人工智能超级智能法案》,但监管共识仍然难以达成。
此刻尤为微妙。Anthropic 预计将在 10 月中旬启动其 IPO 路演。OpenAI 也在积极迈向成为上市公司。前美国 AI 沙皇 David Sacks 在 X 平台上建议,在调查 Coxon 的指控期间,应暂停 Anthropic 的公开发行。
