OpenAI 修复 GPT-6 Astra 模型三大缺陷,重置 Codex 订阅用户的使用限额
核心要点:
- Astra 用户在过去一周中发布了一系列对比测试,声称该模型自发布以来已被悄然削弱。
- OpenAI 的 Codex 负责人指出了三个导致问题的原因,其中包括一项影响了约 4,000 至 5,000 名用户的上下文管理实验。
- 该公司此前的旗舰产品 GPT-5.6 Sol 在七月也曾面临类似的指控。
OpenAI 修复 Astra 的质量缺陷
Codex 产品负责人 Tibo Sottiaux 表示,团队与用户合作追踪故障根源,随后发布了修复补丁,并在当地时间午夜前全面重置了使用限制。据周六发布的更新消息显示,主要问题包括以下几个方面:
首先,为早期模型编写的技能触发过于频繁,有时甚至阻止 Astra 对自身工作进行检查。其次,一项可选的上下文管理实验可能导致模型过早终止或回复过时信息;在影响约 4,000 至 5,000 名用户后,OpenAI 已禁用该实验。此外,部分引擎配置不当,导致通过它们路由的尾部流量质量出现可测量的下降。为此,公司移除了这些引擎并进行了多项较小的修复。Sottiaux 指出,目前模型能更准确地跟踪用户的最新消息。
Astra 用户报告编码能力倒退
投诉在社交媒体平台 X 上持续发酵。开发者们在保持所有设置不变的情况下,对发布当天的 Astra 版本和当前版本运行相同的提示词,并对结果进行了比较。曾在前几天称赞该模型的开发者 Pranjal Paliwal 重新审视了模型为他编写的代码,并将结果定性为“倒退”而非进步。
编码工具 Opencode 的构建者 Dax Raad 表示,由于使用 Astra 的成本翻倍且带来的负面影响被认为不值得,他已将团队切换回较旧的 GPT-5.6 Sol 模型。一位论坛发帖者描述称,在相同任务下,Astra 的表现已与 Sol 持平,重试次数也相同。不过,并非所有人都接受这一观点。一位化名 Antikythera 的用户辩称,该模型一直存在懒惰倾向且喜欢使用项目符号,因此用户只是不再对其感到惊艳。
计算限额笼罩 GPT-6 Astra 的前景
自该模型于九月初广泛可用以来,容量问题一直困扰着其推广进程。据用户报告,OpenAI 已削减重度 ChatGPT 用户的 Astra 使用限额,并暂停了新 $200 Pro 订阅的申请,这一举措已由 Sottiaux 于 9 月 10 日确认。目前,该模型的价格仍为每百万输入令牌 10 美元,每百万输出令牌 50 美元,这是 Sol 发布时价格的 2.5 倍。
这是两个月内第二个 OpenAI 旗舰产品因付费用户提出相同指控而陷入争议。今年七月,用户反映 Sol 的最高推理模式一夜之间变得浅薄,Sottiaux 否认了故意削弱的说法,同时证实公司一直在进行关于推理努力的实验。