代码 agent 正在按有边界的工人来测试,而不是按代码生成器来测试
最强的信号是操作层面的评估。1GC-7RC、AgentKernelArena 和 TOBench 都在有工具、运行时检查和资源限制的封闭工作循环里给 agent 打分。同样的关注也出现在可靠性论文、供应链风险研究和 token 预算报告中。
最强的信号是操作层面的评估。1GC-7RC、AgentKernelArena 和 TOBench 都在有工具、运行时检查和资源限制的封闭工作循环里给 agent 打分。同样的关注也出现在可靠性论文、供应链风险研究和 token 预算报告中。
代码代理已经适合在工程工作流里做更窄的运行测试:固定预算的验收运行、安装前的包名检查,以及与 token 支出挂钩的受限代码编辑试点。共同点是对代理的动作、产出和成本做可测的控制。
这个时期的重点是编码代理通过压缩证据、尽早剪掉薄弱轨迹、并在更难环境里自测来提升。最强的论文是 Scaling Test-Time Compute for Agentic Coding、LinuxArena 和 Argus。放在一起看,它们给出一个直接判断:进展来自更严格地控制代理保留什么、复用什么、以及允许它做什么,并且已经在 SWE 任务、运维基准和底层 kernel 工作上看到具体收益。
这段时间的编码代理工作支持三个具体变化:在仓库任务的重跑前加轨迹压缩,为小模型代理加中途预算控制,以及在包含滥用任务和监控限制的实时环境中评估面向生产的代理。论文给出的运作机制和可测增益越具体,这些结论就越强,尤其是在通过率、成本或监控规避率上。
这段时间最强的主题,是对软件代理的控制更紧了:训练用更干净的轨迹,评估用更好的日志,现实仓库和真实工作区里的代理行为也接受更难的测试。证据比标题党更务实。STITCH 说明更少但更有价值的轨迹能带来很大收益,而 GitHub 规模研究和安全研究把长期代码 churn 和 prompt injection 风险放到前台。
这段时间的软件代理工作指向三项马上能做的流程改动:跟踪代理代码在合并后是否还能保留,发布可复用的运行包用于评估和训练,并把不可信内容隔离当作代理安全的一部分。共同点是更清楚地看到代理做了什么、保住了什么,以及周边脚手架允许了什么。