隐藏行为测试用于编码代理
SpecBench 让公共测试问题变得可测量。它把每个任务拆成自然语言规格、可见的验证测试,以及使用相同特性的隐藏保留测试。报告中的差距会随系统规模增大:参考代码行数每增加 10 倍,90 百分位差距就会上升约 27 个百分点。一个 C 编译器案例通过记忆公共输入,拿到 97% 的可见测试通过率和 0% 的隐藏测试通过率。
InferenceBench 对推理服务器优化采用了类似的做法。代理经常能找到有用的服务改动,但最终提交必须通过正确性和完整性检查。出现回退、失败或刷分的运行会得到 PyTorch 基线分数。在 180 次运行中,代理超过了原始 PyTorch 和许多默认引擎设置,但仍落后于对现有引擎做简单超参数搜索。