主题概况

工具使用

趋势
1
想法
0
最近一期
2026-W19
趋势 · 周 · 2026-W19 · Software Intelligence

编码代理面临更严格的信任测试:执行轨迹、仓库纪律和行动前检查

本周研究把大语言模型(LLM)编码代理视为需要先给出证据才能被信任的系统。最有力的工作通过执行、仓库任务、形式化证明、工具契约和对抗性安全测试来检查生成代码。SWE Atlas、VeriContest 和 RubricRefine 展示了同一个实用标准:有用的代理必须留下可检查的证据,处理常规工程工作,并避免不安全操作。