主题概况

Benchmark Contamination

趋势
1
想法
1
最近一期
2026-W25
趋势 · 周 · 2026-W25 · Software Intelligence

编码智能体需要轨迹、gate 和范围化记忆来赢得信任

本周的大语言模型(LLM)智能体工作把自主性当作证据问题处理。最有力的声明把任务成功与轨迹、可执行测试、范围化权限和有来源支撑的记忆配对。ProcGrep、SWE-Future 和 Machine Studying 显示了当前重点:根据智能体做了什么、知道什么,以及哪些检查成立来评判它们。

想法 · 周 · 2026-W25 · Software Intelligence

代码智能体验收控制

代码智能体采用正在转向具体的验收检查:经过失败测试的仓库指令、围绕智能体工作的轨迹门禁,以及面向陌生语料的分配前考试。有用工作位于模型周围的支持层:智能体被告知了什么、它实际做了什么、它使用了哪些证据,以及在人类评审结果前通过了哪些检查。