可审计的代理运维
代理团队现在有了可以直接照搬的审计关卡:基准的发布前 reward-hacking 运行、带 trace 要求的集中治理 MCP 服务器,以及代码翻译的路径级审查。共同的压力是运维层面的:分数、工具调用和翻译后的代码都需要保留证据,供别的团队事后检查。
代理团队现在有了可以直接照搬的审计关卡:基准的发布前 reward-hacking 运行、带 trace 要求的集中治理 MCP 服务器,以及代码翻译的路径级审查。共同的压力是运维层面的:分数、工具调用和翻译后的代码都需要保留证据,供别的团队事后检查。
当天最强的研究把大语言模型(LLM)当作需要证据门禁的依赖项。C2VEval 暴露了视觉到代码的捷径,Claw-Eval-Live 按真实工作流轨迹打分,IronCurtain 则把安全主张和测试桩、可执行证明绑定在一起。
部署 LLM、工作流代理和视觉转代码工具的团队,可以在更大范围上线前增加小型检查:针对托管模型变化的契约测试、针对代理试点的基于轨迹评分,以及针对视觉对齐失败的空输入测试。
当天最强的工作把代码代理当作必须遵守项目上下文、处理多文件工作流并接受可追踪证据检验的系统。Context-Augmented Code Generation 给出了最清晰的产品上下文结果。BenchGuard 和 TraceToChain 关注的是测试和可靠性声明是否可信。
团队可以先用小型 harness 把编码代理放到项目规则、基准工件和迁移契约的约束下测试,再信任更大规模的自动化。证据支持对代理 PR 加产品上下文门控、对执行型基准做自动审计,以及对无服务器迁移做分阶段检查,以保持生成代码和基础设施一致。
这一时期最强的工作收紧了生成与可执行证据之间的联系。KISS Sorcar、AgentEval 和 ClawMark 都按系统能完成什么、能追踪什么、能在真实工作流中承受什么来评分。SeGa 和 Optimas 把同样的思路扩展到基于需求的测试和基于性能分析器的优化,并在真实漏洞和测得的加速上取得了具体收益。
可执行证据正在进入日常工程流程。这里最清楚的切口是:agent CI 直接指向失败步骤、基于需求的业务逻辑测试生成,以及用执行结果验证每次修改的 profiler 引导 GPU 优化循环。
4 月 25 日的编码研究,最强的地方在于主张能碰到可执行证据。Simulating and Evaluating Agentic Systems 和 CUJBench 都坚持用完整运行、工具轨迹、状态变化和可复现产物来评判代理。仓库工作仍然很难:RAT 改善了配置,但真实提交研究还是显示生成之后会出现编译、分析和测试失败。
可执行证据正在成为代理评估和编程工作流的实际标准。近期最清晰的落地方向有三个:一个可回放的评估器,用真实状态和工具轨迹来检查;一个仓库接入层,在补丁生成前证明环境能跑起来;以及一个在没有测试用例时使用教师样例的科学编程流程。
这个时期的重点是编码代理通过压缩证据、尽早剪掉薄弱轨迹、并在更难环境里自测来提升。最强的论文是 Scaling Test-Time Compute for Agentic Coding、LinuxArena 和 Argus。放在一起看,它们给出一个直接判断:进展来自更严格地控制代理保留什么、复用什么、以及允许它做什么,并且已经在 SWE 任务、运维基准和底层 kernel 工作上看到具体收益。
这段时间的编码代理工作支持三个具体变化:在仓库任务的重跑前加轨迹压缩,为小模型代理加中途预算控制,以及在包含滥用任务和监控限制的实时环境中评估面向生产的代理。论文给出的运作机制和可测增益越具体,这些结论就越强,尤其是在通过率、成本或监控规避率上。