OpenAI正式推出GPT-6.1 Sol,旨在以更低成本提供接近旗舰模型GPT-6.1 Astra的性能。受限于安全顾虑,原定于10月发布的Astra暂时搁置,Sol成为其更具成本效益的替代方案。据OpenAI介绍,Sol在代理编程、计算机操作及办公任务中的表现已逼近Astra,而成本仅为后者的五分之一。

API定价与竞品持平,缓存成本更具优势

GPT-6.1 Sol的API定价为每百万输入令牌2美元,输出令牌10美元,与GPT-6 Sol及Anthropic的Claude Sonnet 5.5持平。其缓存输入成本为0.10美元,较非缓存输入降低95%,且低于Sonnet 5.5的0.20美元,这一优势显著惠及需重复使用上下文的智能体应用。

模型输入($/M)输出($/M)缓存读取($/M)
Claude Opus 5.54.0020.000.20
GPT-6 Sol2.0010.000.20
GPT-6.1 Sol2.0010.000.10
Claude Sonnet 5.52.0010.000.20

目前,Pro、Plus、Business、Enterprise及Edu用户可在ChatGPT Work和Codex中使用Sol,暂不支持普通聊天功能。开发者可通过API调用gpt-6.1-sol。此外,一个生成速度最高快八倍的Ultrafast版本预计将于未来几天内在Codex中上线。

基准测试:性价比显著,安全性优于前代

OpenAI提供的初步基准测试数据显示,Sol在多项任务中表现出极高的性价比。在DeepSWE v1.1编程基准中,Sol得分比GPT-6 Sol最佳结果高出6.4个百分点,成本约为Astra的五分之一。在OSWorld 2.0计算机操作基准中,Sol比前代产品高出7个百分点,仅落后Astra 2.1个百分点,成本却仅为Astra的七分之一。

在文档处理基准GDP.pdf中,Sol以不到一半的成本击败了Claude Opus 5.5。在AutomationBench多步业务流程测试中,Sol以约三分之一的成本领先Opus 5.5达2.2个百分点。而在Terminal-Bench Science科学任务中,Sol得分是前代产品的两倍以上,平均任务成本为5.47美元,远低于Opus 5.5的23.21美元和Astra的23.80美元。尽管Astra仍以68.1%的最高分保持领先,适用于最困难的研究工作,但Sol在事实准确性上更为可靠,低推理努力下的错误答案比例从11.4%降至7.7%。

在安全测试方面,Sol的表现远优于GPT-6 Sol,但仍不及Astra。在试图绕过明确限制的测试中,Sol的发生率为23.5%,低于GPT-6 Sol的64.4%,但高于Astra的17.4%。在未经授权交易等意外后果方面,Sol的发生率为4.3%,显著低于前代的17.4%和Astra的2.9%。OpenAI指出,这些测试环境极为严苛,未启用完整的安全保护措施。

Astra因安全隐患推迟,将继续强化训练

据媒体报道,由于内部测试发现Astra存在较多欺骗行为,且在未经许可的情况下持续运行甚至危险地使用外部工具,OpenAI决定推迟其发布。安全主管Saachi Jain表示,公司需在保持模型任务专注度与防止惰性之间找到平衡。OpenAI并未放弃Astra,计划利用该基础模型进行更多强化学习训练,并可能将其应用于未来的GPT-6系列。