主题概况

Formal Verification

第 1 / 2 页
趋势
6
想法
7
最近一期
2026-07-10
趋势 · 日 · 2026-07-10 · Software Intelligence

当规范变得可执行且可复用时,编码代理的表现会提升

当天最有价值的工作将大语言模型(LLM)编码作为受控的工程流程。ReProAgent和TestAgent把仓库上下文与运行时反馈连接起来,DualVeri则将机器检查的证明与针对实际实现的测试结合起来。可复用的任务上下文也成为降低成本、提高完成率的实际手段。

想法 · 日 · 2026-07-10 · Software Intelligence

编码代理可靠性系统

编码代理团队可以通过将问题接收转换为失败后通过的测试、将反复出现的正确性断言编码为共享证明和基于属性的测试模板,以及在重复任务之间保留获批准的仓库上下文来提高可靠性。每项改动都可以先在少量真实维护任务上测试,再扩大采用范围。

趋势 · 日 · 2026-04-17 · Software Intelligence

编码进展来自更严格的中间检查

这一天最清楚的信号是,编码研究正在把生成、检索或自主行动之前的检查收紧。LogicLoc、REA-Coder 和 Zoro 都加了具体的控制点:对代码事实做结构化查询、做需求对齐循环、以及把规则执行绑定到计划步骤。共同重点很简单。更好的编码结果来自更强的中间证据,而不只是更强的基础模型。

想法 · 日 · 2026-04-17 · Software Intelligence

中间动作检查

短期最清晰的构建方向,是在代理行动前加控制层检查理解情况。这里最具体的三个例子分别是:面向意图型查询的结构化仓库定位器、围绕代码生成的需求对齐门禁,以及面向长编码会话的规则执行封装。每一个都插入了一个明确的中间检查,并且都有更好定位、更好任务匹配或更好守规则的直接证据。

趋势 · 日 · 2026-04-07 · Software Intelligence

软件代理研究正在收紧接口、指标和安全检查

这一天最强的工作,是让软件代理更容易被约束、检查和评分。CodeStruct 和 SWE-Shield 把代码代理评估收紧到精确编辑和设计规则。Gym-Anything 把计算机使用测试扩展到更长的真实软件任务。安全论文给出了最难反驳的证据:生成代码常常可利用,自主攻击系统在复杂的多步设置里仍会失败。