英文原标题:The Agent Said It Was Done. The Database Disagreed.

本文为英文原文的机器翻译摘要,原文见:Hugging Face Blog ↗

Microsoft 与 Hugging Face 联合发布的 ThinkingBox 基准,用「数据库最终状态」而非「生成的话术」来评判 AI Agent,并对 507 个有状态业务流程各重复运行 20 次。结论是:工具调用正确并不等于业务结果正确,单次成功也远不等于可靠。

工具调用不等于业务结果

文章用一个客服案例开场:客户的 745 美元厨电卡在纳什维尔配送中心的「异常」状态,已超出预计送达时间十五天。Agent 完成了九步操作——查订单、查物流、读客户画像、两次检索退款政策、确认无工单后新建工单、记录时间线,并正确判断该客户所属分群不符合延迟赔付条件。

问题出在结尾:它把工单标记为已解决并回复客户,但承运商异常仍未关闭,本应处于「暂停待处理」的结束状态;同时客户真正提出的问题始终没有得到实质答复。作者的判断是:最终回复和合法的工具调用只是代理指标,真正裁定成败的是 Agent 在后台留下的记录。

  • 在一个覆盖 12 个 LLM 模型、121,680 次有效试验的共同集消融中,有 79,853 次尝试未通过可执行检查。
  • 这些失败中有 67.24% 仍然正常结束、调用了改变状态的工具,且未报告任何最终工具错误。
  • 可执行检查发现:77.61% 存在字段值错误,43.30% 存在非预期的额外副作用,25.36% 缺失必需的操作效果(这些发现相互重叠)。
  • 上述客服案例改编自基准任务 sandbox_external_retail_group1.py:test_case_ST003_006,其失败点只在一个字段:工单状态为 solved,而要求为 hold;完整轨迹见论文附录 D.4 案例 3。

单次成功不等于可靠性

文章强调,一个能正确处理一次退款、却在此后四次里出错的 Agent,不算可用的退款 Agent。因此每个任务都会在完全一致的干净后端上独立运行 20 次,并报告三类指标。

pass@1 是多数榜单公布的单次尝试得分,单看它像一份普通的能力排名:Claude Opus 5.5 以 67.16% 整体领先,比 Claude Opus 5 高约两个百分点的一半以内;Kimi-K3 是最强的开源权重模型,与 GPT-6 Astra 相差不到一个点。但文章指出,领域差异同样巨大,例如 Claude Opus 4.6 在零售场景得分 68.62%,在车险场景只有 8.30%。

  • 三个指标分别回答:通常表现如何(pass@1)、是否有可能做到(pass@20,衡量广度)、是否每次都能正确(20 次全部通过的实测计数,不做估计与平滑处理)。
  • 20 次重复后,只有三个模型保住了大部分单次得分:GPT-6 Astra 保留 78%,Claude Opus 5.5 与 Claude Opus 5 各保留 71%。
  • 另一端,GLM-5.1、Kimi-K2.6 与 DeepSeek-V4-Pro 各自只保留约 8%。
  • 结论:一次好成绩只能说明模型「能做」,不能说明它「会再做一次」。

广度与一致性会分道扬镳

文章的图 3 显示,覆盖广度与稳定性并不一致。Kimi-K3 在测试中广度最大,但也属于最不稳定的模型之列;Claude Opus 5 则相反,能解决的任务更少,却能在每次尝试中都完成相当比例的任务。

更新版本并不自动解决这一问题:Claude Opus 5.5 在每次尝试的平均分上高于 Opus 5,也能至少解出更多任务,但 20 次全部通过的任务数与 Opus 5 完全相同。作者由此提醒,如果模型要操作真实记录,pass@20 并不是应当关注的列。

  • Kimi-K3 至少成功一次的比例为 93.89%(507 个任务中 476 个),仅 31 个任务完全失败,为全场最少;零售工作流以 82.24% 的 pass@1 领先所有闭源模型。
  • 但 Kimi-K3 只有 68/507(13.41%)的任务在 20 次尝试中全部成功。
  • Claude Opus 5 至少成功一次的比例为 79.09%(106 个任务完全失败),但 47.53% 的基准任务每次都通过。
  • Claude Opus 5.5 的每次尝试平均分为 67.16%,Opus 5 为 66.50%;两者 20 次全通过的任务数均为 241 个。
  • Kimi-K3 比 Opus 5 多解出 75 个「至少一次」的任务;Opus 5 则比 Kimi-K3 多 173 个稳定通过的任务。

基准如何评测与如何自行运行

ThinkingBox 会在相互隔离的 MCP 工具会话中运行 Agent,然后对其留下的终端后端状态和副作用进行打分,并追问它能否连续二十次做到。该基准现已通过 Hugging Face 提供。

文章说明,这篇内容是与 Hugging Face 的联合博客,作者概述了研究发现、一致性的代价,以及如何通过 OpenEnv 自行运行该基准;文末还列出了失败特征、工作机制与后续方向等章节。

  • 评测对象是 507 个有状态业务流程,每个流程对各种 LLM 模型重复运行 20 次。
  • 打分依据是终端后端状态与副作用,而非最终回复文本或工具调用形式。
  • 读者可通过 OpenEnv 自行运行该基准,基准本身可通过 Hugging Face 获取。

站内导航