来源笔记
Proof-or-Stop: Don't Trust the Agent, Trust the Evidence -- Loop Engineering for Verifiable Evidence-Gated Lifecycle Control
Code IntelligenceAutomated Software ProductionMulti Agent Software EngineeringHuman AI InteractionVerifiable Evidence
摘要
Proof-or-Stop 是一个与模型无关的控制层,只有在新鲜、经过认证且绑定源代码状态的证据通过既定门槛后,才推进自主软件生命周期状态。其评估表明,在单一模型家族和一个自托管实现中,该方法能够可靠地阻止未经支持的声明,并减少可见通过/隐藏失败伪象的传播;但它并未证明语义正确性或广泛泛化能力。
问题
- 自主编码代理可以声称工作已完成评审、测试、完成或准备合并,却不提供当前、完整、获授权且绑定到确切源代码状态的证据。
- 过时日志、自我报告、对可见测试的过拟合或评审者的文字说明,可能导致下游自动化流程推进有缺陷的工作。
- 这很重要,因为合并和完成等生命周期转换可能依据未经支持的声明,成为不可逆的操作决策。
方法
- 将每个具有后果的代理或工作流输出视为声明,而不是生命周期状态;只有当其证据可接受时,门槛才接受该声明。
- 使用材料、提交和故事文件哈希,以及策略和命令集哈希,将结构化证据绑定到当前受跟踪的源代码。
- 验证新鲜度、完整性、完整程度、完整性保护、生产者授权、执行回执、声明支持情况和可接受结果;拒绝缺失、过时、被篡改、未获授权或经过重新配置的证据。
- 门槛失败时,采用有界修复或反思、如实降级、升级处理或停止,而不是推进生命周期。
- 在开源 Proof-or-Stop 系统中实现该方法,并评估其引擎契约、回执验证器、控制策略消融、恢复行为和自应用语料库。
结果
- 无人值守循环引擎在测试的 10/10 个场景中通过,false-done = 0;其本地密钥回执验证器在测试套件中拒绝了 18 类篡改,误接受数和误拒绝数均为零。
- 在涵盖 24 个任务、共 9,240 个单元的统计功效充足的消融实验中,在计算预算受限的朴素循环下,1,800 个注入单元中有 31 个出现可见通过/隐藏失败的放大;在门控循环下为 2 个,未放大比例提高了 1.6 个百分点,95% CI 为 [0.8, 2.5]。
- 近似计算量的比较显示,加入评审者的对照组在 1,800 个单元中有 14 个被放大,而门控循环为 2 个。这表明,将评审作为生命周期门槛加以执行,其作用超出了单纯增加评审者;该效应集中在一个启用陷阱的任务中。
- 自应用语料库包含 565 个故事和 1,007 条评审发现,94.8% 已解决;在精选的 28 条深度集发现中,有 26 条是在作者测试为绿色时提交的。
- 更新后的跨供应商展品包含 26 个故事中的 68 条高严重性/严重性发现,全部已解决;但该结果属于观察性证据,而非受控的边际率估计。
- 证据仅限于一个模型家族、24 个消融任务和一个自托管语料库;论文没有证明语义程序正确性、多模型或外部基准的泛化能力,也没有证明强有力的独立主机法定人数机制。