编码代理的进展来自模型周边的接口
这一时期的基线仍然是可执行评测。最强的主张来自模型外部的部分:SWE-Edit 的读写分离、Agentic Harness Engineering 的 rollout 驱动 harness 编辑,以及 SAFEdit 的测试支撑修复循环。这个方向把上下文、工具、存储、安全提醒和推理成本都当作代理性能中可测量的部分。
这一时期的基线仍然是可执行评测。最强的主张来自模型外部的部分:SWE-Edit 的读写分离、Agentic Harness Engineering 的 rollout 驱动 harness 编辑,以及 SAFEdit 的测试支撑修复循环。这个方向把上下文、工具、存储、安全提醒和推理成本都当作代理性能中可测量的部分。
具体的切入点都在模型周边的代码编辑路径上:更窄的读取结果、专门的补丁执行、带测试的修复循环、可版本管理的 harness 变更,以及来自未覆盖代码的排序报告。团队在改变主开发流程之前,都可以先用现有仓库和可执行测试把这些点验证一遍。
这一天最强的信号是,代码研究正在收紧到可在真实仓库中核查的证据上。CodeSpecBench、R²Eval 和 Ace 从不同角度指向同一个限制:语义理解、仓库上下文和团队协调,比原始生成速度更能限制当前代码代理的能力。
当前的 coding agent 工作指向三个具体变化:把可执行规格检查加进 pull request 审查,把仓库上下文推理 trace 加进评估,并在广泛的模型搜索之前,先把跨文件后续编辑交给 IDE 和语言服务器工具。共同模式很简单:仓库证据暴露出最终补丁评分和本地编辑流程仍然漏掉的失败。