主题概况

Agent Evaluation

第 1 / 4 页
趋势
21
想法
26
最近一期
2026-07-23
趋势 · 日 · 2026-07-15 · Software Intelligence

工具编排选择会改变智能体得分、工具习惯和安全结果

近期关于工程化上下文和可执行检查的证据,正在工具编排框架层面变得更加具体。今天的研究表明,交互协议会改变基准得分,持久会话可能使智能体固守过时的工具使用流程,而有针对性的探索可以改善安全分析。部署仍不成熟:观察到的编码智能体使用并不普遍,而且通常由一个人监督。

想法 · 日 · 2026-07-15 · Software Intelligence

结合交互历史与可执行证据的智能体发布检查

智能体评估应保留那些会改变行为的交互条件;安全和拉取请求工作流则应将有后果的操作绑定到可检查的证据和范围狭窄的授权上。近期最有用的改进包括:测试工具适应能力的发布检查、由证据门控的安全发现,以及围绕当前编码智能体使用中常见的单维护者工作流设计的轻量级授权收据。

趋势 · 周 · 2026-W25 · Software Intelligence

编码智能体需要轨迹、gate 和范围化记忆来赢得信任

本周的大语言模型(LLM)智能体工作把自主性当作证据问题处理。最有力的声明把任务成功与轨迹、可执行测试、范围化权限和有来源支撑的记忆配对。ProcGrep、SWE-Future 和 Machine Studying 显示了当前重点:根据智能体做了什么、知道什么,以及哪些检查成立来评判它们。

想法 · 周 · 2026-W25 · Software Intelligence

代码智能体验收控制

代码智能体采用正在转向具体的验收检查:经过失败测试的仓库指令、围绕智能体工作的轨迹门禁,以及面向陌生语料的分配前考试。有用工作位于模型周围的支持层:智能体被告知了什么、它实际做了什么、它使用了哪些证据,以及在人类评审结果前通过了哪些检查。