Pre-release reward-hacking audits for agent benchmarks
基准维护者可以在发布前加一道红队检查,尝试在不完成任务的情况下拿到任务分,记录利用路径,并在修复后重新运行。BenchJack 给出了一套具体做法:先映射入口点、评分代码、任务文件、环境和信任边界,再按缺陷分类法扫描,最后生成并验证一个像 run.sh 这样的利用脚本,让分数最大化。在它报告的审计中,BenchJack 为测试的 10 个代理基准都生成了可用利用,并找到了 219 个不同缺陷。它的修补循环把 4 个可修复基准的可被攻击任务比例降到 10% 以下,并在 3 轮内把 WebArena 和 OSWorld 全部修好。
发布清单里也应该加入同一批基准运行的 rollout-card 导出。Rollout Cards 会保存任务、环境状态、观察、模型输出、工具调用、工具结果、产物、时间、终态、失败、声明的评分视图、报告规则和省略字段。论文对 50 个仓库的审计发现,没有一个在头部准确率或分数旁边报告失败、报错或跳过的 rollout;对固定产物重新评分后,报告分数最多变化 20.9 个百分点。基准发布可以把未公开的利用扫描和缺失的 rollout 记录都当作阻断项,因为两者都会影响后来用户是否能信任报告分数。