
Anthropic于周二正式发布Claude Haiku 5.5。这款小型模型在AI计算机操作标准基准测试OSWorld 2.1中取得72.4%的得分,与原始评估论文中确立的72%人类基线持平。在定价方面,针对绝大多数现实世界请求(提示词长度低于10万token),其输入价格定为每百万token 0.10美元,较前代Haiku 4.5的1.00美元大幅降低90%。
这两项关键数据标志着Haiku 5.5跨越了从“实用便利”到“可部署子代理”的阈值。凭借极具规模经济性的成本,该模型现已具备处理多模型AI流水线中执行层任务的能力。
子代理经济学:降价重塑成本结构
90%的价格降幅在实际应用中的价值,取决于其在多模型架构中的角色分工。在此类架构中,昂贵的前沿大模型负责规划、推理及边缘情况判断,而更小、更便宜的模型则承担文档摘要、记录分类、长上下文压缩、数据库查询及浏览器任务等重复性执行工作。
此前,当Haiku 4.5输入价格为每百万token 1.00美元时,作为高频子代理每周处理数百万次API调用仍是一笔显著开支。而当价格降至0.10美元时,相较于前沿模型的巨额成本,这部分费用几乎可以忽略不计。
Cognition在其多模型编码平台Devin Fusion中验证了这一转变。通过让Haiku 5.5作为“副手”处理执行任务,并与主规划者Opus 5.5配合,Devin Fusion在FrontierCode 1.1基准测试中获得66.2分,高于单一模型表现,同时降低了单任务成本和延迟。相比之下,单独运行的Haiku 5.5在该基准上得分为46.4%,Sonnet 5.5为52.1%。
对于Anthropic列举的用例——包括文档摘要、上下文压缩、数据库查询、记录分类、浏览器自动化和实时客户支持——Haiku 5.5已具备足够能力处理这些高吞吐量任务,且成本大致相当于零。
双层定价机制解析
每百万输入token 0.10美元的优惠价格仅适用于提示词长度低于10万token的请求,Anthropic表示这约占Haiku 4.5所有请求的90%。超过该阈值的请求定价为每百万输入token 0.50美元,虽高于低价档,但仍比前代费率降低50%。
完整定价对比如下:
| Haiku 5.5 (≤100k tokens) | Haiku 5.5 (>100k tokens) | Haiku 4.5 | |
|---|---|---|---|
| Input tokens | $0.10 / M | $0.50 / M | $1.00 / M |
| Output tokens | $0.50 / M | $2.50 / M | $5.00 / M |
| Cache writes | $0.125 / M | $0.625 / M | $1.25 / M |
| Cache reads | $0.01 / M | $0.05 / M | $0.10 / M |
这种双层级结构源于Haiku 5.5架构的变化。该模型采用了与Sonnet 5.5和Opus 5.5相同的更新分词器,在更细粒度的语义层面运行。虽然提高了每个token的能力,但也导致每个任务产生的token数量略多于前代。Anthropic的双层定价旨在校准这一变化:对于约90%低于10万token阈值的请求,大幅的单token折扣足以抵消token数量的增加,实现真正的90%成本降低。综合所有请求类型,Anthropic估计有效成本降低幅度约为75%。
性能表现:首个追平人类基线的小型模型
在OSWorld 2.1基准测试中,Haiku 5.5在离线子集上得分72.4%,成为首个达到人类基线阈值的小型模型。作为参考,Haiku 4.5在同一评估中仅得15.7%;OpenAI的可比小型模型GPT-6 Luna得分为48.9%;Anthropic更大的Sonnet 5.5则以83.9%领先。
在知识工作评估中,Haiku 5.5同样表现强劲。在涵盖九个行业44种职业真实专业任务的GDPval-AA v2.1基准中,Haiku 5.5录得1,620分,是Haiku 4.5(735分)的两倍多,并超越GPT-6 Luna的1,437分。配套的AA-Briefcase v1.1评估显示一致排序:Haiku 5.5为1,578分,GPT-6 Luna为1,336分,Haiku 4.5为614分。
在研究生级别学术推理测试“人类最后考试”(Humanity's Last Exam)中,Haiku 5.5在无工具情况下达到45.9%,有工具情况下达到57.4%,远高于Haiku 4.5的10.2%和18.7%。
在涉及复杂多步命令行任务的Terminal-Bench 4.0中,Haiku 5.5得分为39.2%,而Haiku 4.5得分为零,GPT-6 Luna为16.4%。值得注意的是,Epoch AI独立分析指出,约15%的OSWorld任务可通过终端快捷方式而非真正的GUI导航完成,约30%可用脚本替代GUI交互。因此,这些分数部分反映了脚本技能及真正的计算机使用能力。
新功能:可调节努力程度
Haiku 5.5首次在小型模型类别中引入了“可调节努力程度设置”(Adjustable Effort Setting)。此前,该功能仅存在于Sonnet 5.5和Opus 5.5等大型模型中,允许开发者在耗时、成本与准确性之间进行权衡。
现在,开发者可以在Haiku定价范围内,将努力程度从Low调至Max。这一功能对于流水线尤为重要:当子代理遇到接近其固定计算性能极限的任务时,可被指示在该任务上深入思考,而无需路由至更昂贵的模型。
企业早期反馈
五家早期试用公司分享了初步结果:
- Asana:在其AI Teammates产品中使用Haiku 5.5,任务延迟降低30%,每次代理轮次的推理速度提高高达2.5倍。
- HubSpot:在内部CRM任务套件测试中录得92.8%的成绩,创该套件历史最高分,同时在陈旧记录识别任务中具有最快完成时间、最高命中率及最低误报率。
- AlphaSense:每周处理约八百万次API调用,质量分数从Haiku 4.5的0.76提升至0.84。
- Box:在成本报告和财务摘要等分析任务上,得分比前代高出11分,延迟几乎减半。
上述数据来自Anthropic发布材料,反映客户生产部署结果,非标准化第三方审计。
平台其他变更
伴随Haiku 5.5发布,Anthropic开发者平台还进行了三项调整:
- Sonnet 5.5缓存读取减半:价格从每百万token 0.20美元降至0.10美元。Anthropic估计,这将使典型代理任务上运行Sonnet 5.5的整体成本降低约20%。
- 订阅者每月API积分:向Claude Platform Max订阅者推出每月积分。Max 5x计划用户每月100美元,Max 20x用户每月200美元,Team计划订阅者在用户间最高可共享500美元。积分可用于任何Claude模型。
- 计算机操作SDK测试版:发布支持Python和TypeScript的计算机操作和浏览器操作SDK测试版。结合Haiku 5.5的速度、低成本及改进的OSWorld分数,该模型被定位为浏览器自动化和桌面控制任务的理想选择。
安全性与可用性
Anthropic报告称,Haiku 5.5在对齐评估方面有显著改善,包括减少不对齐行为及降低对滥用尝试的配合意愿。其网络安全评分比Haiku 4.5更严格,但略低于Sonnet 5.5和Opus 5.5的安全标准,以允许更广泛的防御性安全任务,同时阻止渗透测试和攻击者导向技术。生物安全标准与Sonnet 5和Opus 5一致。
Claude Haiku 5.5已通过Claude Platform以及Amazon Web Services、Google Cloud和Microsoft Azure上线。开发者可通过API字符串claude-haiku-5-5访问该模型。
常见问题解答
Claude Haiku 5.5与Haiku 4.5有何区别?
Haiku 5.5采用了与Sonnet 5.5和Opus 5.5共享的更新分词器,并首次在Haiku系列中引入可调节努力程度设置。在基准测试中,其OSWorld 2.1得分从15.7%跃升至72.4%,追平人类基线。对于大多数现实世界请求,输入价格从每百万token 1.00美元降至0.10美元。此外,Haiku 4.5为固定推理模式,而Haiku 5.5允许开发者调节努力程度。
Claude Haiku 5.5如何融入多模型AI流水线?
Anthropic将Haiku 5.5定位为子代理模型,用于处理由Opus 5.5等大型模型规划后的高吞吐量执行任务(如文档摘要、数据库查询、浏览器自动化)。每百万输入token 0.10美元的价格使其在规模上具有经济可行性,可将子代理层的成本降低90%,从而改变整个系统的经济模型。
Claude Haiku 5.5真的能使用计算机吗?
是的。其在OSWorld 2.1上的72.4%得分匹配了人类基线,使其成为首个达到该阈值的小型模型。该模型可通过鼠标和键盘命令控制计算机,导航应用程序和浏览器,并在真实的Ubuntu环境中完成多步任务。Anthropic同步发布的SDK提供了集成层。需注意,OSWorld部分任务可通过脚本完成,因此分数也反映了脚本能力。
什么是可调节努力程度设置,为什么它对Haiku很重要?
该设置允许开发者控制模型在生成响应前执行的计算推理量。在Low设置下,模型快速回答;在更高设置(最高至Max)下,模型运行扩展推理链,以速度和成本的增加换取更高准确性。此前该功能仅限大型模型。对于部署Haiku为子代理的开发者而言,这意味着可选择性地增加最难执行任务的推理深度,而无需路由至更昂贵的模型。