主题概况

Software Verification

第 1 / 2 页
趋势
10
想法
10
最近一期
2026-07-14
趋势 · 日 · 2026-07-14 · Software Intelligence

结构化上下文降低智能体成本,但更快的审查仍伴随质量风险

证据进一步支持近期的发现:编码智能体的收益取决于经过设计的上下文和可执行检查。新研究报告了更低的 token 使用量、更窄的搜索范围,以及更好的修复或规范生成结果。然而,一项大规模观察性审查研究将更快的智能体辅助决策与更多质量异味联系起来。大多数结果仍局限于特定基准或组织,因此它们支持对工作流的设计选择,而不是对已部署智能体作出广泛判断。

趋势 · 周 · 2026-W28 · Software Intelligence

可执行控制与验证正在决定编码智能体的上限

本周,编码智能体的进展取决于大语言模型(LLM)周围的控制层,包括可执行 harness、运行时检查和仓库工作流。TTHE 在模型权重冻结的情况下取得了较大提升,长时域评测则暴露出严重的任务完成限制。产品设计采用了类似的控制措施,但对比证据仍然有限。

趋势 · 日 · 2026-07-07 · Software Intelligence

代码代理需要验证器、审查器和基于轨迹的修复

当天的研究将代码代理视为需要在工作过程中接受外部检查的系统。Aria 展示了大规模的验证器门控证明搜索;SWE-Review 加入了面向代码库的审查;TraceProbe 衡量一次运行如何搜索、编辑和验证。当前重点是工作流中的可靠性证据,最终任务分数只是多个信号之一。

趋势 · 周 · 2026-W25 · Software Intelligence

编码智能体需要轨迹、gate 和范围化记忆来赢得信任

本周的大语言模型(LLM)智能体工作把自主性当作证据问题处理。最有力的声明把任务成功与轨迹、可执行测试、范围化权限和有来源支撑的记忆配对。ProcGrep、SWE-Future 和 Machine Studying 显示了当前重点:根据智能体做了什么、知道什么,以及哪些检查成立来评判它们。

想法 · 周 · 2026-W25 · Software Intelligence

代码智能体验收控制

代码智能体采用正在转向具体的验收检查:经过失败测试的仓库指令、围绕智能体工作的轨迹门禁,以及面向陌生语料的分配前考试。有用工作位于模型周围的支持层:智能体被告知了什么、它实际做了什么、它使用了哪些证据,以及在人类评审结果前通过了哪些检查。

趋势 · 日 · 2026-06-15 · Software Intelligence

AI 编码代理正通过轨迹、门禁和证明检查接受评判

这一时期最清楚的判断是:AI 编码代理需要可验证的运行记录。ProcGrep 给动作轨迹打分;VerIbmc 只接受 ESBMC 检查过的不变式;Aegis 用经过证明的安全区封住路由器明文。文章和事故报告提出了同一个实践要点:生成代码很便宜,风险集中在验证上。

趋势 · 日 · 2026-05-28 · Software Intelligence

编码代理正在接受操作性证据、审查门控和可执行检查的评判

当天最强的信号是 AI 编码系统的操作性证据。论文在真实会话中测量代理如何失败,在生产中限制低风险审查,并用规格或领域不变量测试生成代码。RADAR、TRAILS 和 Agora 把重点放在同一件事上:只发布能够被检查、约束或复现的内容。