Pre-write edge-case capture with sandboxed regression checks for high-risk code
在代码助手写第一行之前先问边界情况,这种做法在错误代价高的流程里已经更实用。SolidCoder 说明了最明显的切入点:去掉边界情况规划步骤后,GPT-4o 在 CodeContests 上的 pass@1 从 77.0% 降到 53.3%,损失比去掉后续修复步骤更大。同一篇论文把前置规划和基于性质的断言、沙箱执行、以及修复过程中发现的每个失败测试都保留下来结合在一起。
这里的方案很窄,也容易验证:在 IDE 或 PR 机器人里给容易出错的函数加一个写代码前的边界情况面板,然后自动生成性质检查,并在每次模型改动后保留不断增长的回归测试集。维护解析器、数据转换、定价逻辑和 API 适配器的团队会先受益,因为他们本来就要为合并后才暴露的边界错误付出成本。一个低成本验证方法是把这套流程跑在一组固定的线上缺陷工单上,把首次通过率和缺陷回流率和普通的只靠提示词助手做对比。代价是 token 和 API 用量更高,所以它更适合需要审查的关键代码路径,而不是常规样板代码。