趋势

完整运行循环定义代理式代码评估

日 · 2026-06-04 · Software Intelligence

当天最强的信号是面向代码代理的操作性评估。论文测试反馈轮次、harness 修复、有状态记忆,以及在接近部署条件下的仓库知识。实际问题是:当轨迹、UI 测试、提交记录或重复任务里出现证据后,代理是否会变得更好。

闭环代码代理评估

Asuka-Bench 在初始请求含糊、且有多轮用户反馈的条件下评估网页应用代理。这个基准隐藏完整产品需求,测试浏览器渲染后的行为,并把直接的失败反馈带入后续轮次。报告中的差异很大:三轮之后,按权重计算的任务通过率在 13 种模型-运行时配置之间介于 51.8% 到 90.1%。

ADK Arena 把 Agent Development Kits(ADKs)当作可测量的工程选择。一个编码代理在隔离的 Docker 环境里为 51 个 Python kit 构建基准代理。生成在 57% 的运行中成功,成本在不同 kit 之间相差 5.6 倍。单项基准中最好的代理达到 80% 的任务解决率,中位 kit 达到 32%。

从失败轨迹修复 harness

两篇论文把代理 harness 变成了可测量修复的目标。Retrospective Harness Optimization 会选择过去的高难任务,重新运行这些任务,让代理诊断自己的 rollouts,并通过自我偏好选择一个 harness 更新。在 SWE-Bench Pro 上,它把保留集通过率从 0.59 提高到 0.78,且不需要外部评分。

HarnessFix 给修复过程更细的依据。它把失败轨迹和 harness 代码转成步骤级记录,把失败关联到执行、工具、上下文、生命周期、可观测性、验证或治理层,并应用范围受限的补丁。论文报告,在 SWE-Bench Verified、Terminal-Bench 2.0 Verified、GAIA 和 AppWorld 上,相比初始 harness,保留集性能提升了 15.2% 到 50.0%。

记忆与仓库上下文

记忆工作的评价标准已经转向下游任务效果,而不是一条笔记看起来是否有用。MemOp 只有在记忆让所有测量指标不变或更好,并且至少改善一项时才接受该记忆。它报告单轮任务中最高 5.25 个百分点的成功率提升,以及至少 9.79% 的计算成本下降。

CL-Bench 给出一个提醒:专门的记忆系统并不会自动超过全上下文的 in-context learning。覆盖六个领域时,使用 Claude Sonnet 4.6 的全上下文 in-context learning 在总体结果上领先,而 Mem0 和 ACE 在归一化奖励和增益上落后。

另一条路线是仓库适配。Code2LoRA 根据代码库嵌入生成仓库特定的低秩适配器,并用提交差异更新演化模式。在 RepoPeftBench 上,静态版本的跨仓库 exact match 达到 63.8%,演化版本在持续演化的仓库上达到 60.3% 的跨仓库 exact match。

较新机器人策略正在按预测未来和执行延迟打分较早机器人策略工作正在接受几何、接触和真实执行的检验