编码智能体正按审查负担、运行成本和隔离能力接受评判
本周的证据把编码智能体视为生产系统。最有力的工作衡量了智能体离开单任务演示后的审查负担、token 支出和权限控制。SWE-INTERACT 让顶尖模型的解决率降到单轮结果的大约一半,TraceLab 显示长上下文读取主导服务成本,Securing Agentic Identity 则让可复用 OAuth token 留在智能体运行时之外。
本周的证据把编码智能体视为生产系统。最有力的工作衡量了智能体离开单任务演示后的审查负担、token 支出和权限控制。SWE-INTERACT 让顶尖模型的解决率降到单轮结果的大约一半,TraceLab 显示长上下文读取主导服务成本,Securing Agentic Identity 则让可复用 OAuth token 留在智能体运行时之外。
本周的代码智能体研究提高了有用工作的评测门槛。SWE-Cycle 和 SaaSBench 对设置、集成、测试和交付行为评分。Rollout Cards 为智能体运行增加报告规范。共同要求很直接:智能体需要拿出证据,证明任务是在真实运行约束下完成的。