代码修复的运行时证据
SWE-Doctor 给出了最清楚的基准测试结果。它把缺陷复现测试(BRT)变成补丁生成前的调试探针,把一个 issue 拆成多个行为侧面,并在让智能体修改代码前记录运行时诊断。论文报告的平均结果是 SWE-bench Verified 上 75.7%,SWE-bench Pro 上 59.4%;在 SWE-bench Pro 上比基线智能体高 8.0 到 8.9 个百分点。
验证和研究自动化也在要求执行证据。Soteria 工作用符号执行轨迹训练 Qwen3-8B,并报告当轨迹训练与逐步推理结合时,违规检测提升 17.9 个百分点。Auto-FL-Research 把类似约束用于联邦学习:智能体可以编辑训练方案,而任务配置会锁定数据、指标、通信契约、预算和最终评估路径。