软件智能体研究正收紧到可执行证据和控制循环上
本周的软件智能体研究在“结论能否通过执行和明确控制来检验”这一点上最有说服力。重心很务实:更严格的评估、更紧的上下文与权限边界,以及更强地使用编译器、测试和运行时信号。ProdCodeBench、SWE-STEPS 和 Squeez 很能体现这种重点。
本周的软件智能体研究在“结论能否通过执行和明确控制来检验”这一点上最有说服力。重心很务实:更严格的评估、更紧的上下文与权限边界,以及更强地使用编译器、测试和运行时信号。ProdCodeBench、SWE-STEPS 和 Squeez 很能体现这种重点。
本周指向了 coding agent 工作流中的三个实际改动:用真实生产会话搭建离线回放基准,在 agent 循环中加入工具输出裁剪以减少重复上下文加载,以及按相互依赖的 PR 序列来评估 agent,而不是一次只看一个任务。这三个方向都依赖可执行的检查方式,例如稳定测试、保留的仓库状态,以及可测量的 token 或延迟变化。