来源笔记

ToolMisuseBench: An Offline Deterministic Benchmark for Tool Misuse and Recovery in Agentic Systems

Agent BenchmarkTool UseReliability EvaluationFault InjectionCode Agents

ToolMisuseBench 是一个离线基准,用来测试工具使用型代理在工具调用以特定方式失败时如何失误和恢复。它的主要贡献是确定性、可重放的故障注入,并且有明确的步数、调用次数和重试次数限制,因此可以在受控条件下衡量可靠性。

  • 即使语言理解能力很强,工具使用型代理也常因操作性原因失败,例如参数无效、模式漂移、超时、速率限制、重试逻辑薄弱和授权错误。
  • 现有的代理基准通常测量广泛能力,但不会在固定预算下、用完全相同的失败重放来隔离工具误用和恢复。
  • 这在部署中很重要,因为代理在静态测试里看起来有能力,在严格执行工具模式、策略规则和重试限制后,仍可能反复失败。
  • 论文提出了一个确定性基准,每个任务都包含指令、工具模式、初始状态、成功标准、故障计划,以及步数、工具调用次数和重试次数的预算限制。
  • 它使用覆盖四个领域的离线模拟器:CRUD、检索、文件和调度。故障以可重放方式注入,包括模式漂移、速率限制、超时、授权失败和对抗性的错误重写。
  • 评估不只看最终是否完成任务,还测量成功率、无效调用行为、策略违规、恢复成功率、工具调用效率、预算超支,以及调用上限下的预算化成功率。
  • 发布内容包括数据生成、评估、轨迹日志、汇总报告,以及通过简单的 reset/act 接口支持内置基线和外部代理。
  • 数据集共有 6,800 个任务,划分固定:5,000 个训练集、800 个开发集和 1,000 个公开测试集。
  • 在 1,000 个任务的公开测试集上,三个基线的整体任务成功率都为 0.250。启发式基线平均使用 2.95 次工具调用,而模式修复和策略感知基线平均使用 3.25 次调用。
  • 整体策略违规率中,启发式基线为 0.168,模式修复和策略感知基线都为 0.166。整体恢复率中,启发式基线为 0.000,另外两个基线都为 0.250
  • 对于 超时 故障,启发式基线的成功率为 0.499,模式修复和策略感知基线都为 0.502。超时故障上的恢复率从启发式的 0.000 提升到基于修复的方法的 0.502
  • 对于 模式漂移 故障,启发式基线的成功率为 0.503,模式修复和策略感知基线都为 0.497。模式漂移上的恢复率从启发式的 0.000 提升到基于修复的方法的 0.497
  • 对于 授权速率限制 子集,在发布设置中所有基线的成功率都是 0.000
  • 所有代理的预算化成功曲线都很平,AUC 都是 0.25。论文将这解读为:在当前的故障构成和预算约束下,只改进恢复启发式还不能解决主要瓶颈。