主题概况

Program Repair

第 2 / 2 页
趋势
8
想法
10
最近一期
2026-07-22
趋势 · 日 · 2026-04-19 · Software Intelligence

编码研究正在收紧对代理实际完成内容的检查

4 月 19 日的编码研究,最强的地方在于系统不再相信表面成功。PDB、Prometheus 和 Terminal Wrench 各自加了一层更严格的检查:编辑是否精确,补丁是否符合已验证的需求,代理是否在不欺骗验证器的情况下完成任务。实际信息很清楚。更好的编码代理现在同样依赖评估层和控制层,而不只是依赖原始生成质量。

想法 · 日 · 2026-04-19 · Software Intelligence

Solution Fidelity Controls

这一天的编码代理研究指向三个容易在真实工作流里测试的近期待办事项:给调试代理加 diff 大小控制、在自动修复前先验证可执行需求、以及对基准验证器做对抗性审查。它们有一个共同点:测试通过或任务验证器通过,已经不足以说明系统是否以精确、可审查的方式解决了预期问题。

趋势 · 日 · 2026-04-06 · Software Intelligence

软件代理研究正在收敛到可验证的训练循环和硬控制闸门

这一天最清楚的工作,是让软件代理更容易评分、更容易重跑,也更容易在检查失败时被拦住。Atomic-skill RL、Agent-CoEvo 和 Nidus 分别在训练目标、仓库修复和工程治理三个位置收紧控制环。和前几天相比,重点更少放在证明代理能在真实环境中行动,更多放在建立训练和验证设置,让这些动作可以被测量。

想法 · 日 · 2026-04-06 · Software Intelligence

带执行检查的软件代理工作流

这里最可操作的工作,是把软件代理放进带硬执行检查的循环里。最清楚的近期构建方向有三个:一个会连同代码一起改测试的仓库修复工作器、一个面向高吞吐审计型运营的编译式工作流工具,以及一个用于微服务集成测试的在线依赖模拟器。它们都有明确用户、可控试点,而且报告结果具体到足以放进现有工程流程里验证。

趋势 · 日 · 2026-04-04 · Software Intelligence

编码代理研究正在按执行循环、运行时证据和真实动作控制来评判

这一天最强的论文把编码代理的主张做得更可执行,也更可检查。重点是对代理读什么、记什么、运行什么、以及允许改什么进行具体控制。EnvGraph 和 LiveCoder 把仓库生成和运行时验证、以及多次尝试证据绑定起来。DebugHarness 把修复推进到实时调试。Squeez 和 AmPermBench 收窄了两个运维瓶颈:上下文膨胀和权限覆盖。