OpenAI正式发布两款新模型GPT-6 Sol和GPT-6 Luna。此次发布紧随Anthropic推出旗舰产品Claude Opus 5.5之后,意在进一步巩固其市场地位。

在OpenAI的产品矩阵中,Sol和Luna的定位低于9月发布的GPT-6 Astra。Astra被官方定义为“世界上最智能且对齐度最高的模型”,主要处理最复杂任务;而Sol和Luna则专为日常办公场景打造,提供更快速、更具性价比的选择。

这一产品策略与Anthropic高度相似:GPT-6 Astra对标Claude Fable,Sol对标Claude Opus,Terra对标Claude Sonnet,Luna则对应升级版的Claude Haiku。

价格腰斩,性价比显著

为保持竞争力,OpenAI大幅调整了API定价。相比此前的促销费率,新款模型成本降低50%。具体而言,GPT-6 Sol的价格降至每百万输入Token 2美元、输出Token 10美元(此前分别为4美元和20美元);GPT-6 Luna的价格降至每百万输入Token 0.10美元、输出Token 0.50美元(此前分别为0.20美元和1.20美元)。在各层级对比中,OpenAI的报价均优于Anthropic。

性能基准测试表现

在Zapier构建的AutomationBench基准测试中,该测试评估AI代理利用47种工具完成销售、财务等业务流程的能力。在最高推理设置下,GPT-6 Sol的通过率为33.2%,每项任务成本0.27美元。相比之下,Claude Opus 5在同等设置下的通过率为26.9%,但成本高出一倍以上。GPT-6 Sol的表现也超越了Anthropic更昂贵的旗舰产品Claude Fable 5.1。

在评估AI代理执行长期经济价值工作能力的“Agents' Last Exam”测试中,GPT-6 Sol在最高努力设置下得分为56.4%,优于Claude Opus 5的最佳得分,且任务成本低60%。

此外,OpenAI引入了“推理努力程度”(Reasoning effort)调节选项。调高该设置后,模型将消耗更多计算资源进行自我检查,从而提升准确率,但也会增加成本。在OSWorld 2.0计算机操作测试中,GPT-6 Sol以约80%的成本优势,取得了与Claude Opus 5中低努力程度相当的得分(60.5% vs 60.3%)。

上线情况

目前,GPT-6 Sol和Luna已在ChatGPT Work以及面向Plus、Pro、Business、Enterprise和Edu订阅用户的Codex中上线。其中,Luna还通过桌面端应用向免费用户和Go层用户开放。这两款模型尚未在普通版ChatGPT应用中提供,OpenAI表示将在全天范围内逐步推送,以确保服务稳定性。