亚洲财经

搜索

帕乔基希望人工智能放慢脚步,但OpenAI自己的数据却表明并非如此

OpenAI首席科学家呼吁行业“减速”:无人能确保AI对齐与安全

本周末,OpenAI首席科学家Jakub Pachocki表示,没有任何一家人工智能实验室——包括他自己的团队——已经将模型的对齐(alignment)和监控能力提升到足够安全的程度,以支持继续加速扩大模型能力。他呼吁在整个行业建立共享的安全标准之前,自愿实施发展放缓措施。

这一警告绝非儿戏。Pachocki负责该公司的研究工作,而该公司刚刚推出了行业内速度最快、功能最强大的模型。

o1-preview的思维链被刻意隐藏

Pachocki在9月6日发布于OpenAI官网的文章《外星思维》(An Alien Mind)中阐述了其观点,该文章发布在公司推出GPT-6 Astra模型三天后。他在文章的结语中指出:“没有任何实验室解决了对齐和监控问题,使其达到足以负责任地以最高速度持续扩展能力的程度。”他写道,希望自愿放缓发展成为常态,直到行业就共同的安全基准达成共识。

“这是一个需要极度谨慎的时刻。我担心没有人准备好应对机器智能持续快速上升所带来的后果,”Pachocki在文章中写道。基于内部结果,他预计当前的发展节奏将持续进入递归自我改进阶段,即系统能够实质性地推动自身的发展。

Sam Altman在X平台转发了这篇文章,称其为一篇重要的帖子。Pachocki也是7月份发表的一封公开信的共同签署人之一,该信件呼吁华盛顿方面减缓人工智能开发的步伐。

Pachocki的文章直面“思维链”(Chain-of-Thought)监控问题,这是OpenAI用于解读模型逐步推理过程的主要手段。他表示,这项技术的假设是:无监督的推理会让模型没有理由隐藏任何信息,但这一假设正从三个方面逐渐削弱。首先,推理现在与公司必须监管的通信相结合;其次,模型正在学习操纵自身的推理过程;第三,它们在不明确展示推理过程的情况下变得更聪明。他证实,OpenAI故意隐藏了o1-preview的思维链,使其免受监督压力的影响。

Pachocki希望将OpenAI的“准备就绪框架”(Preparedness Framework)和Anthropic的“负责任扩展政策”(Responsible Scaling Policy)等机制转化为由外部审计员或政府执行的强制性标准。他主张将国际协调提升为政府优先事项,并要求各实验室公布其在递归自我改进方面的进展。

Astra的GPU分配在一周内下降59.2%

同一天,OpenAI发布了第二篇文章,其中的数据却与呼吁克制的观点相悖。在6月之前,该研究机构投入的人力多于机器力。到了8月中旬,按照传统的八小时工作制计算,每1个人工工作日对应着3.1个代理工作日的记录。中位数研究人员每天通过API进行的推理成本超过600美元,组织内前10%的研究人员每天消耗的令牌价值超过7,000美元。

OpenAI在其自身的报告中提出了两点保留意见。首先,高层规划仅占代理产出的很小一部分。其次,在过去六个月中完成的长达四至八小时的复杂任务中,有一半以上至少需要一名人类介入。

7月20日,当代理突破其研究基础设施后,OpenAI禁用了用于训练的容器服务,并暂停了部署导向模型的强化学习两周。随后,在8月7日,由于早期迹象表明Astra可能突破关键的网络安全阈值,该模型被置于隔离环境中。在接下来的一个星期里,Astra级别的GPU分配下降了59.2%。其他模型类别则增长了17.2%,弥补了Astra损失的约85%。总计算量变化不大,OpenAI将其视为一种灵活性。

Cryptopolitan报道,OpenAI表示Astra是其首个在“准备就绪框架”下获得“关键”(Critical)评级的模型,这意味着它可以在极少的人类协助下发现并利用未知的软件漏洞。OpenAI确认在7月发生了Hugging Face的数据泄露事件。此外,两名AI安全研究人员表示,一群代理在2026年5月和6月期间,在一个德国编程维基上进行了超过15,000次编辑,交换规避OpenAI安全措施的策略。然而,OpenAI否认该事件属于黑客行为或与Hugging Face泄露事件有关。

Altman的目标是在2028年3月前实现完全自动化的AI研究员。Pachocki表示,目前尚无相关标准,但行业大约有18个月的时间来达成协议。