微软正式推出ThinkingBox基准测试,旨在通过检查智能体在隔离环境中留下的后端状态及副作用,而非仅凭其生成的自然语言回答,来评估其执行真实业务工作流的可靠性。该基准现已通过Hugging Face开源。

工具调用不等于结果

传统评估往往关注智能体是否调用了正确的工具或生成了看似合理的回复,但ThinkingBox指出,这仅是代理指标。一个智能体可能格式完美地调用了九次工具,却因未正确更新数据库状态(如将应“挂起”的工单标记为“已解决”)而导致任务实质失败。

在涵盖12个大语言模型、超过12万次试验的消融研究中,近80%的尝试未能通过执行检查。其中,67.24%的失败案例虽干净终止且无报错,但数据库中存在错误字段值、意外副作用或缺失必要效应。这表明,只有终端后端状态才是检验智能体能力的唯一证据。

一次性成功不可靠,20次复现才是金标准

为衡量稳定性,ThinkingBox对每个任务进行20次独立重复试验,并引入三个核心指标:

  • pass@1:单次尝试的成功率,反映模型的常规能力。
  • pass@20:20次中至少一次成功的比例,反映模型的能力广度。
  • Observed 20/20:20次全部成功的比例,反映模型的绝对可靠性。

数据显示,许多模型在pass@1上表现优异,但在20次重复中分数大幅缩水。仅有GPT-6 Astra(保留78%)、Claude Opus 5.5和Claude Opus 5(各保留71%)等少数模型保持了较高的一致性。相比之下,GLM-5.1、Kimi-K2.6等模型仅保留了约8%的单次成功率,显示出巨大的稳定性差距。

模型能力图谱:广度与一致性的权衡

在507个有状态工作流测试中,不同模型呈现出鲜明的特性差异:

  • Kimi-K3:覆盖最广的开源权重模型。它在至少一次尝试中解决了93.89%的任务(476/507),零售领域pass@1高达82.24%,领跑所有模型。然而,其一致性较差,仅13.41%的任务实现了20/20全通。
  • Claude Opus 5.5:综合性能领跑者。整体pass@1为67.16%,略高于Claude Opus 5(66.50%)。其在20/20全通任务数上达到241个(47.53%),与Claude Opus 5持平,但以更低的单次尝试成本实现了更高的准确率。
  • GPT-5.4:可靠性与成本的平衡点。虽然pass@1(65.36%)略低于Opus系列,但其稳定性表现出色,且在成本效益上占据优势。

值得注意的是,模型迭代并未完全解决一致性问题。Claude Opus 5.5相比Opus 5在headline准确率上微增0.66个百分点,但20/20全通任务数并未增加,表明单纯的准确率提升未转化为额外的可靠性。

一致性的经济账:谁最划算?

对于企业部署而言,单位成功工作的成本至关重要。研究团队基于OpenRouter列表价格计算了两种成本指标:

  1. 每次成功尝试成本:GPT-5.6 Sol以0.127美元居首,GPT-5.4为0.131美元,Claude Opus 5.5为0.276美元。
  2. 每次可靠任务成本(即实现20/20全通的平均成本):GPT-5.4以6.80美元成为最便宜的选择,尽管其全通任务数(128个)少于头部模型。GPT-6 Astra(7.45美元)和Claude Opus 5.5(7.80美元)紧随其后,分别实现了231个和241个全通任务。

Claude Opus 5虽实现了241个全通任务,但成本高达13.30美元,被Opus 5.5完全主导。这表明,获取正确答案的最廉价方式,并非获取可靠答案的最廉价方式。

失败归因:八成问题出在工具使用

诊断显示,约79.9%的失败源于工具使用问题(如前置条件失败、空查找),而非推理错误。状态更新错误占10.3%,用户解决方案不完整占7.0%。这意味着,智能体通常能推进工作流,却在最后的工具交互环节出错。此外,领域难度差异显著,零售领域平均pass@1为59.52%,而汽车保险领域仅为33.83%。

如何自行运行与未来建议

ThinkingBox基于OpenEnv接口,支持在本地Linux或WSL环境中部署。用户需配置Python 3.11+、Docker及Typesense数据库,并通过MCP服务器连接智能体。基准测试代码采用MIT许可证,数据采用CDLA-Permissive-2.0许可证。

微软建议开发者:

  • 检查终端状态:在生产环境中,不应依赖模型总结,而应直接验证数据库的最终状态。
  • 分类错误并重试:针对可恢复的工具错误建立重试机制,缩小工具表面至工作流必需部分。
  • 人工审批高风险操作:对于不可逆的更改,引入人工批准环节。

ThinkingBox由微软Copilot Studio团队与Toloka合作开发,并有来自匹兹堡大学、西北大学等多所高校的研究者参与。成本数据快照截至2026年9月20日。