Benchmark integrity
在这一时期,智能体基准分数直接承受对抗性压力。BenchJack 审计了 10 个智能体基准,并为全部 10 个生成了可用的奖励黑客利用,按其分类法共发现 219 个不同缺陷。它的修补循环把 4 个可修复基准上的可黑客任务比例降到 10% 以下,并在 3 轮内完全修补了 WebArena 和 OSWorld。
Rollout Cards 处理的是另一类报告问题。论文主张,智能体研究需要回放记录、声明的评分视图、报告规则和缺失字段清单。在对 50 个热门仓库的审计中,没有一个在头条分数旁报告失败、出错或跳过的回放。重新评分已修复的工件后,报告分数最多变化 20.9 分,并且可能在 tau-bench 上交换模型排名。