主题概况

Program Repair

第 1 / 2 页
趋势
8
想法
10
最近一期
2026-07-22
想法 · 日 · 2026-06-25 · Software Intelligence

编码代理控制门禁

编码代理的采用现在有几个具体控制点:可审查的代理配置文件、对测试执行的可测量限制,以及面向安全修复的多层验证。共同的运营问题是,代理工作在自己的循环内常常看起来成功,却留下薄弱的来源记录、高执行成本或不安全的生产变更。

趋势 · 周 · 2026-W25 · Software Intelligence

编码智能体需要轨迹、gate 和范围化记忆来赢得信任

本周的大语言模型(LLM)智能体工作把自主性当作证据问题处理。最有力的声明把任务成功与轨迹、可执行测试、范围化权限和有来源支撑的记忆配对。ProcGrep、SWE-Future 和 Machine Studying 显示了当前重点:根据智能体做了什么、知道什么,以及哪些检查成立来评判它们。

想法 · 周 · 2026-W25 · Software Intelligence

代码智能体验收控制

代码智能体采用正在转向具体的验收检查:经过失败测试的仓库指令、围绕智能体工作的轨迹门禁,以及面向陌生语料的分配前考试。有用工作位于模型周围的支持层:智能体被告知了什么、它实际做了什么、它使用了哪些证据,以及在人类评审结果前通过了哪些检查。

想法 · 日 · 2026-06-16 · Software Intelligence

编码代理验证控制

代理编写的代码需要质量门禁来检查测试实际断言的内容,需要修复循环把有针对性的执行证据传回模型,也需要评估报告区分模型、harness、环境、验证器和技能的影响。共同的操作问题是虚假的信心:PR 可能包含断言很弱的测试,修复代理可能只能看到通过/失败反馈,而排行榜分数可能隐藏能让结果产生两位数百分点变化的 harness 选择。

想法 · 日 · 2026-05-26 · Software Intelligence

代理工作流检查点

编码代理的落地现在需要在开发工作流里增加更小的控制点:在昂贵验证之前加修复门,为生成的规格做可执行检查,以及为工具访问和交接做结构测试。共同的压力很实际:团队需要知道哪个代理步骤失败了,某个声称的修复或规格是否通过了独立检查,以及 token 开销是否对应已接受的工作。

趋势 · 日 · 2026-04-21 · Software Intelligence

代码研究正在围绕生成内容收紧行为检查

4 月 21 日的研究在代码系统面对更严格的行为检查时最强。DebugRepair、PlayCoder 和 MuCoCo 都提出了比标准通过率更难的问题:模型在运行时轨迹、真实交互或等价改写下是否还能站住脚?另一条较小的线索补充了多用户 agent 的操作规则,ClawNet 把身份、权限和可审计性放在中心位置。