OpenAI 发布 GPT-6 Sol 与 Luna,对标 Anthropic 战略
周二,OpenAI 正式发布了两款新模型:GPT-6 Sol 和 GPT-6 Luna。此次发布紧随 Anthropic 推出其最新旗舰模型 Claude Opus 5.5 之后不久。
产品定位与竞争策略
GPT-6 Sol 和 Luna 的定位低于 GPT-6 Astra。今年9月3日,OpenAI 将 Astra 称为“世界上最智能且对齐度最高的模型”。Astra 仍是 OpenAI 处理最复杂任务的首选,而 Sol 和 Luna 则是专为日常工作任务设计的更便宜、更快的选项。
这一策略与 Anthropic 采用的模式高度相似。具体对应关系如下:
- Astra 相当于 Fable
- Sol 相当于 Opus
- Terra 相当于 Sonnet
- Luna 相当于 Haiku(升级后)
价格调整与性价比优势
为了保持市场竞争力,OpenAI 对这两款模型的价格进行了调整。与 GPT-5.6 的促销费率相比,两款模型的 API 每令牌成本均降低了 50%。“令牌”(Token)是模型读取和写入的文本片段,通常略少于一个单词,企业按百万级计费以应对大规模 AI 账单。
具体价格变动如下:
- GPT-6 Sol:输入令牌价格为每百万2美元,输出为每百万10美元(此前分别为4美元和20美元)。
- GPT-6 Luna:输入令牌价格为每百万0.10美元,输出为每百万0.50美元(此前分别为0.20美元和1.20美元)。
总体而言,在各层级对比中,OpenAI 提供的方案更具价格优势。
性能基准测试表现
在由 Zapier 构建的 AutomationBench 基准测试中,重点评估 AI 代理能否利用涵盖销售、营销、运营、支持、财务和人力资源等47个工具完成完整的商业工作流,并以通过率作为评分标准:
- GPT-6 Sol:在最高推理设置下,得分为 33.2%,每项任务成本为 0.27 美元。
- Claude Opus 5:在其顶级设置下,得分为 26.9%,但根据 OpenAI 的数据,其每项任务成本高出超过11倍。
- 对比结果:GPT-6 Sol 在同一测试中也略微超越了 Anthropic 更昂贵的旗舰模型 Claude Fable 5.1。
在另一项名为“Agents' Last Exam”的测试中,该测试评估 AI 代理在55个子行业中执行长期且具有经济价值工作的能力,并以完成百分比进行评级:
- GPT-6 Sol:在最高努力模式下得分 56.4%。OpenAI 表示,这优于 Claude Opus 5 的最佳得分,且每项任务成本低 60%。
推理能力与计算机使用场景
“推理努力”(Reasoning effort)是 OpenAI 新增的一个调节选项:提高该设置会使模型在回答前花费更多时间和计算资源进行自我核查,从而同时提升准确性和成本。
在计算机使用场景——即模拟人类点击、输入和导航软件的操作——OSWorld 2.0 测试中:
- GPT-6 Sol:在 OSWorld 2.0 上,其得分几乎与 Claude Opus 5 的中等努力模式持平(分别为 60.5% 和 60.3%),而成本降低了约 80%。OSWorld 测试长期的真实计算机任务,并根据任务正确完成的程度报告部分分数。
可用性说明
GPT-6 Sol 和 Luna 现已在 ChatGPT Work 以及 Plus、Pro、Business、Enterprise 和 Edu 订阅用户的 Codex 中上线。此外,Luna 也通过桌面应用向免费用户和 Go 用户开放。
目前,这两款模型尚未在普通版 ChatGPT 应用中提供。OpenAI 表示,为了保持服务稳定,将在当天逐步推出这两款模型。