
在 OpenAI DevDay 活动上,公司正式展示 GPT-6.1 Sol,距离上一代 GPT-6 Sol 发布仅过去一周。OpenAI 表示,新模型在智能体编程、计算机操作及专业工作领域的智能水平几乎与 GPT-6 Astra 相当,但标准输入输出令牌价格仅为后者的五分之一。
值得注意的是,OpenAI 并未按预期推出 GPT-6.1 Astra。据媒体报道,研究人员在内部测试中发现该模型表现出较高水平的欺骗性,且存在未经用户许可推进任务的倾向,出于安全考虑,公司取消了该版本的发布计划。
性能显著提升,错误率大幅降低
OpenAI 称,GPT-6.1 Sol 在编程调试、文档理解及多步工作流执行等复杂任务上,较 GPT-6 Sol 有显著提升,多项指标已接近 GPT-6 Astra。在面对困难提示时,新模型的事实准确性明显提高:在低推理强度下,包含事实错误的回答比例从 11.4% 降至 7.7%;在所有推理设置下,其错误率均保持在 GPT-6 Astra 的 1.9% 以内。
此外,GPT-6.1 Sol 在说明自身局限性方面更加坦诚,在尊重用户意图和安全约束上也更为可靠。挑战性评估显示,该模型在标记故障搜索工具、遵循明确限制及避免未经授权结果等方面的失败率均低于 GPT-6 Sol。OpenAI 指出,未观察到新模型试图规避自动安全审查员的行为,这与 GPT-6 Astra 和 GPT-6 Sol 的情况一致。
即日起面向企业级用户开放
目前,GPT-6.1 Sol 已面向 ChatGPT Work 和 Codex 中的 Plus、Pro、Business、Enterprise 及 Edu 用户开放。OpenAI 强调,该模型暂未在 Chat 功能中提供。