编码智能体规划、重新生成与审查中的验证调整
编码智能体工作流应将验证预算用于证据不完整的地方:向审查者公开行为和状态转换,使用现有测试套件之外的反例测试依赖替代实现,并要求多个智能体检查同一修复时提供彼此不同的诊断证据。
编码智能体工作流应将验证预算用于证据不完整的地方:向审查者公开行为和状态转换,使用现有测试套件之外的反例测试依赖替代实现,并要求多个智能体检查同一修复时提供彼此不同的诊断证据。
应将仓库上下文作为运行依赖进行测试。实际可采取的改动包括:对检索进行故障注入,在代码完成前设置安全专用上下文门禁,以及在基础设施证据缺失或过时时明确升级处理。
本周,编码智能体的进展取决于大语言模型(LLM)周围的控制层,包括可执行 harness、运行时检查和仓库工作流。TTHE 在模型权重冻结的情况下取得了较大提升,长时域评测则暴露出严重的任务完成限制。产品设计采用了类似的控制措施,但对比证据仍然有限。
编码代理团队可以通过要求提供可执行的缺陷复现、针对保留任务测试控制程序修改,并利用实时覆盖率信号监督测试生成,来改进仓库工作。每项改动都可以在固定模型上试点,并与当前流程进行衡量。
代理产品正被设计成受控的运营系统。OneDev 将编码工作固定在议题、拉取请求和持续集成(CI)中;Avriz 通过影子测试和流量上限控制学习型模型路由;Mango 将记忆和权限保存在用户设备上。实测证据并不均衡。最强的基准测试也只覆盖 10 个合成拉取请求,而大多数产品声明缺乏比较评估。
团队可以通过将代理工作附加到现有审查记录、在范围明确的生产工作负载上评估模型,并把记忆控制作为可观察的产品行为进行测试,更安全地采用代理。现有测量数据有限,因此每次部署都应从范围受限的试验和明确的运营指标开始。
最有说服力的工作把上下文处理当作工程控制。qMLX 在一台 Mac Studio 上减少了长上下文的重复预填充,ContextOps 则在推理前检查输入载荷的结构。AgentTransfer 将同样的操作纪律用于文件交换。现有证据支持可检查的组件,但多个项目仍缺少独立基准测试。
代理团队可以在三个具体边界提高可靠性:跨轮次保留可复用的推理状态,在每次模型调用前检查组装好的上下文,以及验证代理之间传递的文件。每项改动都可以先从本地回归测试开始,再扩大部署范围。
当天最有价值的工作将大语言模型(LLM)编码作为受控的工程流程。ReProAgent和TestAgent把仓库上下文与运行时反馈连接起来,DualVeri则将机器检查的证明与针对实际实现的测试结合起来。可复用的任务上下文也成为降低成本、提高完成率的实际手段。
编码代理团队可以通过将问题接收转换为失败后通过的测试、将反复出现的正确性断言编码为共享证明和基于属性的测试模板,以及在重复任务之间保留获批准的仓库上下文来提高可靠性。每项改动都可以先在少量真实维护任务上测试,再扩大采用范围。
当天的证据集中在实际问题上:编码代理需要更安全的执行边界、更好的任务输入,以及成本更低的重复执行能力。Claude Code、Codex 和 SpellSmith 提供了安全方面的主要案例;生产实践和基准测试论文给出了具体指标。
编码代理的采用面临三个具体的运维问题:不可信仓库可能诱导代理运行攻击者代码,重复事件持续产生完整的推理成本,面向人工编写的问题文本可能让修复代理缺少判断依据。最实际的改进包括限制仓库和 MCP 工具使用的执行检查、将经过验证的事件轨迹转化为操作手册的升级规则,以及在问题提交时收集可执行的修复证据。