Pull request checks for executable preconditions and postconditions
评估 coding agent 的团队可以把可执行规格检查加入仓库任务的审查流程。CodeSpecBench 说明了这件事为什么重要:函数级规格生成的通过率达到 47.0%,但在 500 个 SWE-bench Verified 问题上的仓库级表现,最好模型也只到 20.2%。这个差距指向生产代码审查里的一个明确失败模式:agent 可能生成看起来合理的补丁,却没有捕捉到预期的输入约束、状态假设或输出保证。
一个可行做法是在 CI 里增加一步:让模型针对 pull request 涉及的函数写出前置条件和后置条件,把它们和现有测试及生成测试一起运行,再把不匹配的地方标出来供审查者检查。对已经在 Python 服务或库里使用 agent 生成补丁的团队,这个流程很合适,因为输出是可执行的,而且可以用他们今天信任的同一套测试工具来检查。一个低成本试点是对一个仓库里的 bug 修复 PR 做一周试验:记录生成的规格有多常失败,但补丁在审查里仍然看起来可接受,以及这些失败是否比现有测试更早暴露隐藏的语义回归。