来源笔记

CUJBench: Benchmarking LLM-Agent on Cross-Modal Failure Diagnosis from Browser to Backend

LLM AgentsFailure DiagnosisBenchmarkingCross Modal ReasoningBrowser To Backend

CUJBench 是一个用于诊断软件故障的基准,故障从浏览器可见症状开始,并延伸到后端遥测。它把每个事件打包成一个确定性的快照,方便比较不同 LLM 代理在同一跨模态诊断任务上的表现。

  • 现有根因分析基准主要关注后端日志、链路和指标,而 Web 代理基准主要关注在正常应用里完成任务。这两类基准都没有测试把浏览器中的受损用户路径和后端原因连接起来的诊断能力。
  • 真实的事故诊断常常从截图、网络请求或控制台错误开始,再转向链路、日志和最近变更。现有基准缺少这条从浏览器到后端的推理路径。
  • 运行中的环境会引入噪声,让代理之间的比较不可靠,所以一个有用的基准需要固定证据和可重复的工具输出。
  • 论文构建了 CUJBench,这是一个失败的关键用户旅程(CUJ)基准,记录为冻结的多模态快照,包含前端证据、后端可观测性和运维上下文。
  • 它使用两个开源应用 OpenTelemetry Demo 和 Tractor Store,覆盖后端主导、浏览器主导和跨模态故障。
  • 语料包含 87 个标注场景,分属 五类故障:基线、浏览器代理故障、后端标志故障、复合故障和前端变异。
  • 场景生成使用一个 LLM 辅助生成流程,先产出 120 个候选场景,再通过多代理审查循环筛选,其中包括两名 SRE 审查者、一名资深审查者和人工核验。最终接纳了 120 个中的 87 个场景。
  • 评估使用固定的工具接口和确定性的缓存响应,工具包括截图和 HAR/网络数据等浏览器工具,日志和链路等后端工具,以及最近变更和服务拓扑等上下文工具。
  • 在该基准上,六个前沿模型的 总体准确率只有 19.7%,报告的 上限为 52%,说明这个任务远未解决。
  • 论文在 三种基线 下评估了 六个模型:仅检索、仅浏览器和全工具集。
  • 一个主要的实证结论是,仅浏览器代理的整体表现优于全工具集代理,这说明额外工具往往让代理扩展证据搜索范围,却没有提高聚焦程度。
  • 基准分析认为主要瓶颈是 跨模态综合:代理常常找到了关键证据,却无法把它和真正原因对应起来。
  • 论文引用的先前后端工作报告,在 OpenRCA 上,五个前沿模型的完全正确 RCA 准确率只有 3.9% 到 12.5%,这把 CUJBench 定位成一个更难、范围也更广的诊断场景。
  • 摘录没有包含按模型划分的得分表、按数据集划分的指标,或仅浏览器与全工具集之间的精确差值。