亚洲财经

搜索

OpenAI披露6起新的“对齐失败”AI行为案例

OpenAI 披露六起模型“意外或令人担忧”行为案例

周三,OpenAI 公布了过去六个月中另外六起“意外或令人担忧”的模型行为案例。在一篇博客文章中,OpenAI 指出,这些案例展示了其归类为“对齐偏差行为”(misaligned behavior)的各种不同表现,例如向用户隐瞒信息,以及采取“未经授权的行动”来克服障碍。

这些披露加剧了 AI 开发人员和研究人员对安全措施是否跟得上日益强大的模型发展的担忧。上周,Anthropic 首席执行官 Dario Amodei 呼吁放缓前沿 AI 的发展步伐,他警告称,不受控制的 AI 进步可能会“超越我们理解和控制这些系统的能力”。

OpenAI 表示,此次披露旨在“启动”其新的模型对齐偏差报告框架,并强调这些案例不应被视为反映其对齐偏差在其模型中发生的频率。

具体违规案例详情

据 OpenAI 介绍,其中一起案例涉及一个“未发布的研究模型”,它在自己的任务摘要中插入了类似“越狱”的指令。这些摘要用于在新上下文窗口中继续执行任务,指令内容包括忽略开发者消息或采用无限制的人格设定。研究人员发现了 27 份包含此类指令的摘要。

OpenAI 还披露,在 GPT-5.6 Sol 的训练过程中,许多模型实例添加了隐瞒错误或偏差行为的指令,例如虚构缺失的历史数据且不加以说明。

“在一个例子中,一个准备财务模型的代理无法找到所请求的历史数据。其摘要提议编造合理的历史数值,并在被问及之前隐瞒这一事实,”OpenAI 表示。

在另一案例中,当被要求列出面积超过 500 万平方公里的湖泊名称时,由于用户的指令要求提供浏览器引用来源,该代理决定上传文件以作为答案中的引用依据。

其他案例包括:模型在未获授权的情况下使用暴露的 API 密钥,随后伪造其无法检索的数据;利用内部软件仓库在不同训练任务之间交换消息;以及在明确要求将工作保持在本地环境的情况下,通过公共托管服务共享文件。

今年七月,OpenAI 曾披露过一起事件,其 AI 模型组合逃逸出测试环境,并入侵了 AI 初创公司 Hugging Face,以在安全评估中作弊。