
智能体在预演中表现正常,却在现场演示或生产环境中因路径差异而失败,这在金融核对或合同审查等关键任务中可能引发灾难性后果。大多数基准测试将这种变异性隐藏在平均值背后,导致“高准确率”掩盖了低可靠性。
被平均值掩盖的“一致性差距”
标准评估通常报告 Mean@k(k次运行的平均通过率),但这无法回答用户的核心关切:“再次发出相同请求,结果是否依然可靠?”为此,需引入 Pass^k 指标,即智能体在所有 k 次运行中均成功的任务比例。
以 AppWorld 基准测试为例,基于 GPT-4.1 的 ReAct 智能体 Mean@5 高达 77.4%,但 Pass^5 仅为 53.0%。这意味着近四分之一的任务存在“有时成功、有时失败”的不稳定性,两者之间存在 24.4 个百分点的一致性差距。在困难任务中,这一差距甚至达到 30 个百分点。需注意,Pass^k(每次都必须成功)与常见的 Pass@k(至少一次成功)截然不同,前者是衡量可靠性的悲观镜像。
诊断根源:尖锐分布与平坦分布
这种不一致性并非能力不足,而是源于大语言模型决策概率分布的形状。当分布“尖锐”时,最优 token 优势明显,决策稳定;当分布“平坦”时,多个 token 概率势均力敌,微小的系统噪声(如 GPU 浮点数非结合性)即可导致决策翻转。即使将温度设为 0.0,托管端点的细微扰动仍足以改变平局结果,导致由数十个决策组成的轨迹出现累积偏差。
解决方案:一致性分析与指南生成
为解决这一问题,研究团队在 ALTK-Evolve 系统中引入了一致性分析器(Consistency Analyzer)和一致性指南(consistency guidelines)。
1. 诊断:一致性分析器无需真实标签或端到端重跑任务,仅需对记录的历史轨迹进行离线重采样。通过对每个决策点一次性抽取 k 个完成结果(默认 k=5),识别出那些模型输出极易变化的“易翻转”步骤。
2. 修复:针对识别出的不稳定决策点,系统自动生成可重用的“一致性指南”并注入推理过程。例如,针对笔记计数任务,指南会明确建议使用“基于行锚定的正则表达式”而非简单的子字符串计数,以消除歧义。
效果:差距减半且无损准确率
在 AppWorld test_normal 数据集上的评估显示,引入一致性指南后:
- 一致性差距大幅缩小:Pass^5 从 53.0% 提升至 69.0%,Mean@5 从 77.4% 提升至 81.0%,一致性差距从 24.4pp 降至 12.0pp。
- 难度越高获益越大:中等和困难任务的 Pass^5 分别提升 22.9pp 和 14.3pp,相对增幅均约 45%。
- 具备泛化能力:将指南应用于同一场景的其他相关任务,Pass^5 仍提升 13.0pp;在较弱模型 gpt-oss-120b 上,泛化增益甚至超过同任务增益,证明其捕获的是可迁移的失败模式而非记忆特定轨迹。
该方法在不牺牲平均准确率的前提下,显著提升了智能体的可信赖度。完整方法论及评估数据已在 arXiv 技术报告中公布,相关工具已在 ALTK-Evolve 开源仓库中上线。