主题概况

Agent Evaluation

第 4 / 4 页
趋势
21
想法
26
最近一期
2026-07-23
想法 · 日 · 2026-05-12 · Software Intelligence

可审计的代理运维

代理团队现在有了可以直接照搬的审计关卡:基准的发布前 reward-hacking 运行、带 trace 要求的集中治理 MCP 服务器,以及代码翻译的路径级审查。共同的压力是运维层面的:分数、工具调用和翻译后的代码都需要保留证据,供别的团队事后检查。

趋势 · 日 · 2026-04-26 · Software Intelligence

可执行证据正在为编码和代理研究定节奏

这一时期最强的工作收紧了生成与可执行证据之间的联系。KISS Sorcar、AgentEval 和 ClawMark 都按系统能完成什么、能追踪什么、能在真实工作流中承受什么来评分。SeGa 和 Optimas 把同样的思路扩展到基于需求的测试和基于性能分析器的优化,并在真实漏洞和测得的加速上取得了具体收益。

趋势 · 日 · 2026-04-25 · Software Intelligence

可执行证据正在抬高编码和代理研究的门槛

4 月 25 日的编码研究,最强的地方在于主张能碰到可执行证据。Simulating and Evaluating Agentic Systems 和 CUJBench 都坚持用完整运行、工具轨迹、状态变化和可复现产物来评判代理。仓库工作仍然很难:RAT 改善了配置,但真实提交研究还是显示生成之后会出现编译、分析和测试失败。

想法 · 日 · 2026-04-25 · Software Intelligence

可执行的编程证据

可执行证据正在成为代理评估和编程工作流的实际标准。近期最清晰的落地方向有三个:一个可回放的评估器,用真实状态和工具轨迹来检查;一个仓库接入层,在补丁生成前证明环境能跑起来;以及一个在没有测试用例时使用教师样例的科学编程流程。

趋势 · 日 · 2026-04-16 · Software Intelligence

编码代理的进展来自更严格地控制轨迹、成本和环境

这个时期的重点是编码代理通过压缩证据、尽早剪掉薄弱轨迹、并在更难环境里自测来提升。最强的论文是 Scaling Test-Time Compute for Agentic Coding、LinuxArena 和 Argus。放在一起看,它们给出一个直接判断:进展来自更严格地控制代理保留什么、复用什么、以及允许它做什么,并且已经在 SWE 任务、运维基准和底层 kernel 工作上看到具体收益。

想法 · 日 · 2026-04-16 · Software Intelligence

面向编码代理的自适应控制层

这段时间的编码代理工作支持三个具体变化:在仓库任务的重跑前加轨迹压缩,为小模型代理加中途预算控制,以及在包含滥用任务和监控限制的实时环境中评估面向生产的代理。论文给出的运作机制和可测增益越具体,这些结论就越强,尤其是在通过率、成本或监控规避率上。