
Anthropic于周二正式发布Opus 5.5模型,刷新了编码与知识工作领域的性能标杆。值得注意的是,该模型在多项基准测试中击败了体量更大的Fable模型,并成功完成了后者未能处理的非正式任务。Anthropic将其评价为“迄今为止测试过的最强模型”。
在成本控制方面,Opus 5.5显著优于前代产品。其输出令牌价格降至每百万令牌20美元,较上一代的25美元有所下调,其他指标价格也呈现类似降幅。此外,模型运行速度的提升反映出整体计算需求的降低。
交互体验上,Opus 5.5大幅优化了沟通方式:减少专业术语的使用,并倾向于将关键信息置于消息开头,以提升阅读效率。
快速迭代与安全对齐
此次发布距离7月24日推出Opus 5仅过去两个月。Anthropic透露,Sonnet 5.5和Haiku 5.5将在“未来几周内”陆续上线,预计带来同等幅度的性能提升。
安全层面,Opus 5.5在生物学和网络安全领域的能力已媲美Mythos模型,因此沿用了与Fable模型相同的安全保障措施,严格限制其在挖掘编译程序漏洞或开发生物武器识别工具等高风险任务中的应用。
这是Anthropic首席执行官达里奥·阿莫迪(Dario Amodei)呼吁放缓前沿AI发展后的首次新品发布。阿莫迪主张刻意控制能力提升速度,以确保风险预防措施能够同步跟进。他在本月初的文章中指出:“应对风险需要更加谨慎,不仅要投资于预防,更要让预防措施有时间跟上能力发展的步伐。”
Opus 5.5的安全训练流程与前代大致相同,包括由METR和Frontier Design等外部机构执行的对抗性测试与发布前评估。Anthropic强调,针对未来更先进模型的训练与评估系统已在筹备中,旨在构建更完善的安全监控基础设施。公司表示,随着AI能力增强,公共政策应在保障系统安全性方面发挥更大作用,相关细节将于近期公布。