面向代码代理的仓库感知编辑、恢复与评估
代码代理的控制机制可以更贴近工作的语义:需求链接能够约束跨文件编辑,不变量违规可以改进恢复决策,而受控的代码变换则能揭示仓库检索究竟何时节省了工作量。现有证据支持有针对性的评估,但不足以支持广泛的生产环境结论。
代码代理的控制机制可以更贴近工作的语义:需求链接能够约束跨文件编辑,不变量违规可以改进恢复决策,而受控的代码变换则能揭示仓库检索究竟何时节省了工作量。现有证据支持有针对性的评估,但不足以支持广泛的生产环境结论。
这一时期把编码 agent 视为带有状态、测试、故障恢复和可追踪控制的软件系统。i cat-agent 提供了最强的正向结果;ToolBench-X 和 CodeChat-Eval 暴露了 agent 在工具故障和后续编辑下的脆弱行为。
编码代理的采用已经适合转向更窄的测试架工作:分离的 bug 修复角色、围绕不可靠工具的恢复测试,以及面向库行为重叠团队的基于意图的测试迁移。证据最强的部分来自报告可执行评估、测量回归,或通过工作流水线发现真实缺陷的论文。