针对代理编写的拉取请求进行风险触发的差分测试
开源维护者可以在仓库清单中,将每类贡献风险映射为可执行的测试义务。对于普通库变更,代理应识别修改的函数和公共入口,生成变更前后对照测试,并附上观察到的行为差异和联合覆盖率。编译器或工具链变更则可以触发区域级模糊测试,记录到达相关覆盖缺口所需的程序结构和选项。DiffTestGen 在 463 个拉取请求中的 78.2% 发现了行为差异,而 GapForge 通过覆盖缺口定位发现了 12 个编译器故障;Agent Governance Manifest 则单独表明,明确的风险和证据规则提高了审阅者准确恢复风险标签的能力。
具体做法是在清单中加入受影响的执行目标、允许的行为变更、所需的测试模式、覆盖率证据和未解决缺口等字段,同时由维护者保留最终接受决定。一项低成本检查是,按照这套政策重新评估近期由代理编写的拉取请求,并将新发现的行为和审阅耗时与项目当前的通用 CI 证据进行比较。