Evidence-rich control loops are the center of agentic coding work
这一时期把大语言模型(LLM)代理当作可训练、可检查的软件系统。EvoTrainer、FLARE 和 SPOQ 的证据最强:更好的代理来自诊断、带门控的执行和任务结构,人类判断出现在规划和验证环节。
这一时期把大语言模型(LLM)代理当作可训练、可检查的软件系统。EvoTrainer、FLARE 和 SPOQ 的证据最强:更好的代理来自诊断、带门控的执行和任务结构,人类判断出现在规划和验证环节。
当团队保留中间证据时,智能体编码工作会更容易改进:修复循环里的可疑行、多智能体执行中的明确依赖门禁,以及终端代理训练中的轨迹质量信号。实际工作是给现有代理加上小型评分和验证层,然后比较最近任务的通过率、评审负担和返工量。
当前重点:编码 agent 按运行方式、修复能力和边界内行为来评判。A-ProS 展示了有状态评审反馈带来的提升。ProcBench 对轨迹中的过程缺陷打分。OverEager-Bench 衡量 benign 任务中的未授权动作。
编码代理团队可以把运行时范围、轨迹质量和文件选择分开测试。证据支持在更广泛部署前先做几项实操检查:捕捉越界动作、给代理日志里的流程缺陷打分,以及在迭代修复前缩小修复上下文。
当天最强的主题是围绕 LLM 编码系统的控制。新工作尝试压缩到真正相关的代码,追踪自然语言/程序边界上的流动,并用更严格的权限限制代理动作。它们在修复和分析基准上都有可量化的收益,但证据也表明,单靠更强的定位或更多上下文,仍然补不上剩下的质量差距。
围绕 LLM 编码系统,三条控制点上的具体工作正在成形:在修复前压缩仓库上下文、在 LLM 调用边界上恢复污点和切片、以及限制编码代理在开发者机器上能碰什么。证据最强的是那些报告了修复准确率、分析质量或操作工作流可测效果的论文;安全工具还处在早期的地方,证据较弱,但已经具体到可以直接测试。