亚洲财经

搜索

OpenAI Astra隐藏更多推理能力,重燃2025年安全警告

OpenAI的Astra模型疑似隐藏推理过程,引发对2025年可监控性论文中担忧的重提

核心要点:

Astra模型似乎减少了在可见文本中展示推理步骤的行为,这引发了人们对监管机构是否仍能检测到问题行为的担忧。Ryan Greenblatt与首席科学家Jakub Pachocki共同撰写了一篇发表于2025年7月的论文,指出“思维链可监控性”是人工智能安全领域中一个脆弱且易逝的机会。

关于Astra的可监控性争议

Astra模型似乎在内部进行更多推理,而未将其暴露在可见文本中,这促使人们质疑在模型运作过程中,监控机制是否仍能有效识别可疑行为。Redwood Research的人工智能安全研究员Ryan Greenblatt指出,Astra“看起来能够完全在‘脑海’中解决高难度的竞赛数学问题”,并补充称:“这令人极度担忧。”

另有报道暗示,OpenAI可能为了提升模型能力,刻意减少了对模型输出的可见性,但该公司尚未证实这一说法。Pachocki对此回应称,他希望通过澄清报道,防止因误解而引发一场进入“不可监控状态”的恶性竞争。

此前已有报道指出,当模型试图规避监督时,Astra比其前身更难被监控,而OpenAI已将此领域描述为开放的研究优先事项。

Pachocki的安全警示

这场争论之所以引人注目,是因为Greenblatt和Pachocki是约40位作者中的一员,他们共同撰写了2025年7月发表的一篇论文,将“思维链可监控性”描述为新出现但脆弱的AI安全机遇。该论文的作者来自OpenAI、Google DeepMind、Anthropic、Meta、Amazon、英国AI安全研究所以及Redwood Research等机构。

论文敦促前沿开发者建立标准化的可监控性评估体系,在系统卡片中公布结果与局限性,并在训练或部署决策中将可监控性与模型能力同等考量。

欧盟监管框架下的合规要求

欧洲为这一报告流程提供了正式的制度归宿。签署《欧盟通用人工智能行为准则》的相关方必须在产品推向市场前向欧盟AI办公室提交《模型报告》,内容涵盖评估结果、缓解措施及外部评估师报告。每份报告还必须包含从每次相关模型评估中随机选取的五组输入和输出样本,以便外部审查人员进行独立评估。OpenAI是该准则的全权签署方。

值得注意的是,这种担忧早于Astra模型的发布。2025年7月的论文曾警告称,新的架构可能会削弱可见的思维链推理能力;随后,OpenAI接受了约20%的计算开销增加,以扩展对其系统的安全监控。