Trace-based harness repair queue for coding agents
运行编码代理的团队应该为失败轨迹加一个修复队列。队列里要保存工具调用、观察结果、文件变更、最终提交,以及每次运行产生的 harness 代码版本。之后,审查者或修复代理就能把每个失败归到具体的 harness 区域,比如工具 schema、上下文组装、生命周期控制、日志、验证、沙箱或策略检查。
HarnessFix 给出了一种可用模式:把原始轨迹转成步骤级记录,把每个错误结果连到某个 harness 层,生成范围受限的补丁,再验证补丁是否能减少目标缺陷,同时不引入大范围回归。RHO 为没有标注验证集的团队提供了更轻量的部署循环:挑出困难且多样的历史失败,重新运行,让代理比较自己的 rollout,然后接受比基线更受偏好的 harness 更新。一个小的起步测试可以用 20 到 30 个最近失败的编码代理任务,并在选出候选补丁后,只把相似问题的留出集用于检验。