Execution-backed validation
最强的论文会先加入更严格的执行证据,再相信代码结果。DebugRepair 通过模拟插桩收集运行时状态,在 Defects4J 和 DeepSeek-V3 上报告了 295 个正确修复,并且相对每个骨干模型的原始设置平均提升 51.3%。PlayCoder 在 GUI 任务上说明了同样的问题:编译和单元测试通过会漏掉很多交互缺陷,论文还显示 GPT-5 和 Claude-Sonnet-4 这类强模型从 Exec@3 到 Play@3 的下降幅度很大。Cascade 把执行检查用到文档上。它先把 API 文档转成测试,再要求这些测试在当前代码上失败、在重生成的代码上通过,然后才判定不一致;在额外仓库里它发现了 13 个未知问题,其中 10 个后来被修复。