可执行控制与验证正在决定编码智能体的上限
本周,编码智能体的进展取决于大语言模型(LLM)周围的控制层,包括可执行 harness、运行时检查和仓库工作流。TTHE 在模型权重冻结的情况下取得了较大提升,长时域评测则暴露出严重的任务完成限制。产品设计采用了类似的控制措施,但对比证据仍然有限。
本周,编码智能体的进展取决于大语言模型(LLM)周围的控制层,包括可执行 harness、运行时检查和仓库工作流。TTHE 在模型权重冻结的情况下取得了较大提升,长时域评测则暴露出严重的任务完成限制。产品设计采用了类似的控制措施,但对比证据仍然有限。
编码代理团队可以通过要求提供可执行的缺陷复现、针对保留任务测试控制程序修改,并利用实时覆盖率信号监督测试生成,来改进仓库工作。每项改动都可以在固定模型上试点,并与当前流程进行衡量。
Agent 的性能越来越取决于模型周围的可执行控制层。TTHE 通过根据无标签轨迹编辑 harness 来改进固定的大语言模型(LLM),Long-Horizon-Terminal-Bench 则显示了当前 agent 在持续终端工作中的性能会多快下降。仓库级检查补足了这一点:实用的 agent 需要自适应控制、密集评估和结构验证。
代理团队可以通过针对有界工作流调整控制程序来降低推理成本,通过基于轨迹的 harness 修改改善部署后的行为,并通过检查点级评分诊断长时间运行。每项改动都需要可执行的上线测试,因为代理指标、工作负载多样性和超时可能扭曲总体成功率。
这一时期把编码 agent 视为带有状态、测试、故障恢复和可追踪控制的软件系统。i cat-agent 提供了最强的正向结果;ToolBench-X 和 CodeChat-Eval 暴露了 agent 在工具故障和后续编辑下的脆弱行为。
编码代理的采用已经适合转向更窄的测试架工作:分离的 bug 修复角色、围绕不可靠工具的恢复测试,以及面向库行为重叠团队的基于意图的测试迁移。证据最强的部分来自报告可执行评估、测量回归,或通过工作流水线发现真实缺陷的论文。
这一时期把编码代理视为需要可审计任务来源、可执行安全证据和感知运行框架评分的产品。SWE-Future 处理基准污染;Code-Augur 把安全假设记录为断言;Cursor + Claude Fable 5 显示,同一模型在另一种代理运行框架下的得分可能差异很大。
编码代理工作正在转向几类检查:保留任务来源、区分可见正确性与隐藏安全行为,并把代理推理转化为可执行证据。这些实际改动足够小,可以放进现有评估和安全工作流中测试:让同一个模型通过多个运行框架执行,要求安全专用隐藏测试,要求审计代理写出可证伪断言,并基于截止日期前可用的仓库证据构建面向未来的任务。
代理编写的代码需要质量门禁来检查测试实际断言的内容,需要修复循环把有针对性的执行证据传回模型,也需要评估报告区分模型、harness、环境、验证器和技能的影响。共同的操作问题是虚假的信心:PR 可能包含断言很弱的测试,修复代理可能只能看到通过/失败反馈,而排行榜分数可能隐藏能让结果产生两位数百分点变化的 harness 选择。
当天最强的信号是对 AI 辅助编码的实际控制。Model Context Protocol harness、Agent Joe 和并行代理提示都把代理当作需要限定上下文、限制动作并设置明确审查点的工作者。
编码代理工作正朝着更小的规则表面、更窄的操作集合和定时的人类审查移动。真正有用的变化是代理配置迁移工具、安全本地编码的受限命令面,以及在长时间 AI 会话中强制做范围审查的检查点提示。
这一时期的基线仍然是可执行评测。最强的主张来自模型外部的部分:SWE-Edit 的读写分离、Agentic Harness Engineering 的 rollout 驱动 harness 编辑,以及 SAFEdit 的测试支撑修复循环。这个方向把上下文、工具、存储、安全提醒和推理成本都当作代理性能中可测量的部分。