主题概况

Agent Evaluation

第 2 / 4 页
趋势
21
想法
26
最近一期
2026-07-23
想法 · 日 · 2026-06-11 · Software Intelligence

代理自主性检查点

编码代理团队现在有了几个可以加控制的具体位置:仓库说明的可执行检查、代理拉取请求进入审查前的拒绝门,以及用于 CAD 工作的沙箱化程序动作通道。共同压力来自审查浪费和不安全的自主性,尤其是在代理可以修改仓库、发起拉取请求或操作专业 Windows 软件的工作流里。

想法 · 日 · 2026-06-04 · Software Intelligence

Coding Agent Feedback Loops

编码代理评估在记录完整运行循环后更有用:请求、轨迹、反馈、harness 变更和下一次尝试。实际工作是围绕失败轨迹、浏览器可见的 UI 行为,以及经过测量的仓库记忆做小型评估器,然后再把代理使用范围扩大到更多团队。

趋势 · 日 · 2026-05-28 · Software Intelligence

编码代理正在接受操作性证据、审查门控和可执行检查的评判

当天最强的信号是 AI 编码系统的操作性证据。论文在真实会话中测量代理如何失败,在生产中限制低风险审查,并用规格或领域不变量测试生成代码。RADAR、TRAILS 和 Agora 把重点放在同一件事上:只发布能够被检查、约束或复现的内容。