Agent output needs specs, traces, and reproducibility checks
几篇论文都在给 AI 编码工作的检查层施压。规格治理论文把 AI 编码收益和审查负担、上下文限制、可测试规格联系起来。它引用了任务层面的正面研究,也报告了经验丰富的开发者在成熟代码库上变慢、随着 AI 采用率提高交付稳定性下降的证据。
AutoMat 给出了最直接的实证警告。在测试过的代码智能体配置里,最佳结果只复现了 85 个计算材料科学主张中的 54.1%。仅靠论文复现时,各系统的成功率几乎为零,这说明缺失的流程、领域工具和脆弱的执行仍然是当前的失败点。
RECAP 直接处理编辑器里的测量问题。它在 VS Code 中记录 Copilot 聊天、shadow git 提交和细粒度编辑。在一次课程部署中,它捕获了 2,034 条提示和 8,239 次提交,让反复的错误循环和 AI 编辑占比在会话层面变得可见。