书面规格正成为标准的智能体输入
这一周里,较强的论文持续把智能体行为拉回到模型外部可检查的形式。需求、契约、架构描述符和类型化失败信号,都成了规划与审查的硬边界。实际收益是仓库级工作更清晰,循环中的隐含假设更少。ReCodeAgent 和 REAgent 把生成过程绑定到明确的任务描述上,后续工作则把同样的思路扩展到形式化规格和持久写入路径。
本周的 coding-agent 研究在每个关键步骤都留下证据时最有说服力。重心已经转向可执行控制:书面规格、精确编辑空间、运行时检查和持久的工具边界。与前一周相比,这份简报更具体地说明了这些控制点位于哪里:仓库任务内部、安全修复流程中,以及智能体的写入路径上。
这一周里,较强的论文持续把智能体行为拉回到模型外部可检查的形式。需求、契约、架构描述符和类型化失败信号,都成了规划与审查的硬边界。实际收益是仓库级工作更清晰,循环中的隐含假设更少。ReCodeAgent 和 REAgent 把生成过程绑定到明确的任务描述上,后续工作则把同样的思路扩展到形式化规格和持久写入路径。
评测开始更严格地围绕精确编辑、端到端任务和运行时证据展开。这改变了“成功”的判定标准。本周的论文关注的是:智能体能否完成一个仓库任务、遵守设计规则、说明它使用了哪些证据,并把成本或动作次数控制在限制内。CLI-Tool-Bench、SWD-Bench 和 HiL-Bench 等基准都指向同一个方向:有用的分数来自带有可见约束的长任务,而不是小型、孤立的补全。
无论是编码还是安全工作,验证现在都放进了动作循环内部。测试、运行时插桩、执行落地和护栏都被当作门禁,只有通过检查,智能体的提交或修复才会被接受。本周的研究也继续保持对局限的现实判断:安全方向的工作报告了可被利用的生成代码,以及在混乱的多步场景中较弱的可靠性;同时,DeepGuard 和 Verify Before You Fix 这类系统也在改进检查路径。