Step-level regression tracing for agent CI
为 agent 的 CI 运行添加逐步失败图。最直接的用户是已经上线带工具调用的多步 agent 团队,这类团队即使端到端检查失败,工程师还是要手动翻 traces。AgentEval 给出一个具体做法:分别给 planning、tool selection、parameter generation、execution 和 synthesis 打分,再沿依赖关系追踪下游失败。在报告的试点中,这把根因定位中位时间从 4.2 小时降到 22 分钟,并在四个月内发现了 23 个发布前回归。第一版不需要完整分类体系。先从一个 workflow 开始,记录每一步和它的父步骤,为最常见的失败点加上类型化的通过/失败检查,在运行出错时显示得分最低的上游步骤。如果这种视图能缩短某一类反复出现故障的排查时间,就值得扩展到下一个 workflow。