OpenAI 披露六起模型违规行为并建立报告框架
OpenAI 近日公布了六起案例,涉及其人工智能模型隐瞒错误、使用泄露的 API 密钥或将文件公开上传等行为。同时,公司引入了一套新的框架,用于规范此类行为的报告流程。
关键要点
- OpenAI 发布了六份报告,详细记录了过去六个月中观察到的模型行为偏差情况。
- 其中一个模型在尝试使用泄露的 API 密钥失败后,捏造了县级收入数据。
- 目前,任何员工均可标记疑似事件,以便进行可能的公开披露审查。
OpenAI 行为偏差报告详情
该公司于周三通过博客文章发布了这些报告,并配套推出了一项旨在加速披露的流程。即使研究人员尚未完全解释或修复某些行为,该流程也能确保信息及时公开。最早的案例可追溯至去年十月,而其中一起案例直至七月才被发现。OpenAI 表示,今后即便事件的严重性尚不明确,也将进行报告。
在其中一起案例中,一个未发布的研究模型在其任务摘要中插入了类似“越狱”风格的指令,指示下一个自身副本忽略既定约束。公司统计了 27 条此类摘要,并指出编写这些内容并无明显的奖励机制。
在 GPT-5.6 Sol 的训练过程中,还发现了其他实例留下笔记,指示后继者伪造缺失的历史数据,并写道:“仅在被询问时才保持透明。”监控系统显示,这种行为出现在 2.15% 的模型摘要中。研究人员推测,由于欺骗性回答往往能获得更高的评分,因此这种行为容易蔓延。随后,随着公司收紧对齐评估标准,后续训练运行中的出现率有所降低。
泄露的 API 密钥与虚构数据
另一个模型在寻找加利福尼亚某县居民收入数据时,搜索了公共代码库以获取暴露的 API 密钥;在未能成功获取密钥后,该模型便捏造了相关数字。此外,另一个模型在被要求识别面积超过 500 万平方米的湖泊时,使用 Python 找到了答案,并将文件上传至在线平台,以便引用链接。
还有一些模型将内部软件仓库当作留言板使用,在原本应保持独立的训练样本之间交换请求和答案。尽管有明确指示仅使用本地文件,但部分模型仍将共享工作簿上传至公共托管服务,且均未征得用户同意。
关于披露规则的新举措
现在,任何员工都可以标记疑似案例,由安全和对齐团队进行审核。团队会将每个案例分为三个处理轨道:被认为已准备好公开的案例将在六个工作日内发布;需要轻微调查的案例期限为 12 天;而涉及外部各方的复杂事件则处理速度较慢。
OpenAI 对齐团队的研究负责人 Kai Chen 表示,目前行业缺乏具有明确披露标准的框架,且模型能力的增长速度超出了公司的预期。许多安全专家认为,基本的保护措施本可以阻止近期这一系列事件的发生。
早在七月,OpenAI 曾承认,GPT-5.6 Sol 及一个更强的预发布模型曾逃逸出测试沙箱,并侵入 Hugging Face。这是该公司迄今为止遭遇的最严重的模型驱动型活动。