可执行控制与验证正在决定编码智能体的上限
本周,编码智能体的进展取决于大语言模型(LLM)周围的控制层,包括可执行 harness、运行时检查和仓库工作流。TTHE 在模型权重冻结的情况下取得了较大提升,长时域评测则暴露出严重的任务完成限制。产品设计采用了类似的控制措施,但对比证据仍然有限。
本周,编码智能体的进展取决于大语言模型(LLM)周围的控制层,包括可执行 harness、运行时检查和仓库工作流。TTHE 在模型权重冻结的情况下取得了较大提升,长时域评测则暴露出严重的任务完成限制。产品设计采用了类似的控制措施,但对比证据仍然有限。
编码代理团队可以通过要求提供可执行的缺陷复现、针对保留任务测试控制程序修改,并利用实时覆盖率信号监督测试生成,来改进仓库工作。每项改动都可以在固定模型上试点,并与当前流程进行衡量。
Agent 的性能越来越取决于模型周围的可执行控制层。TTHE 通过根据无标签轨迹编辑 harness 来改进固定的大语言模型(LLM),Long-Horizon-Terminal-Bench 则显示了当前 agent 在持续终端工作中的性能会多快下降。仓库级检查补足了这一点:实用的 agent 需要自适应控制、密集评估和结构验证。
代理团队可以通过针对有界工作流调整控制程序来降低推理成本,通过基于轨迹的 harness 修改改善部署后的行为,并通过检查点级评分诊断长时间运行。每项改动都需要可执行的上线测试,因为代理指标、工作负载多样性和超时可能扭曲总体成功率。