编码代理研究正在测量用户负担、运行时成本和工具风险
当天最强的工作把编码代理视为需要会话级评测的长时间运行系统。SWE-Together、SWE-INTERACT 和 MirrorCode 让用户反馈、完整程序行为和计算预算进入评分。
当天最强的工作把编码代理视为需要会话级评测的长时间运行系统。SWE-Together、SWE-INTERACT 和 MirrorCode 让用户反馈、完整程序行为和计算预算进入评分。
编码智能体团队现在可以把会话级检查加入发布和运维工作:统计用户纠正的多轮测试、显示重复前缀读取的服务看板,以及在执行前阻止不安全工具序列的 MCP 网关。
当天最强的信号是,在真实约束下对智能体工作的实际测量。MAC 和 TeleSWEBench 显示,智能体在设计另一个智能体和修复领域代码方面的自主性都有限。其余论文集中在让智能体输入、工具和运行时证据可审计。
MCP 服务器团队可以在工具到达代理之前加入描述与代码一致性检查。SDK 文档团队可以给审查代理加一层检索,找到支持断言的跨文件证据。LLM 服务团队可以在输出质量下降但系统未崩溃时,加入比较中间模型状态的差分诊断流程。
这一时期最清晰的信号是在约束下产品化:当编码代理的工作有状态、测试和廉价工具访问时,它们就有用;当平台无法吸收法律、审查或维护成本时,它们就有风险。Flathub、MCP 和 MLSys 提供了最强的证据。
编码代理的采用正受到上下文成本、审查负担和验证薄弱的限制。近期最明确的变化是可测量的工具路由、对生成提交的发布渠道检查,以及对系统代码更严格的证明或基准测试门槛。