编码智能体正按审查负担、运行成本和隔离能力接受评判
本周的证据把编码智能体视为生产系统。最有力的工作衡量了智能体离开单任务演示后的审查负担、token 支出和权限控制。SWE-INTERACT 让顶尖模型的解决率降到单轮结果的大约一半,TraceLab 显示长上下文读取主导服务成本,Securing Agentic Identity 则让可复用 OAuth token 留在智能体运行时之外。
本周的证据把编码智能体视为生产系统。最有力的工作衡量了智能体离开单任务演示后的审查负担、token 支出和权限控制。SWE-INTERACT 让顶尖模型的解决率降到单轮结果的大约一半,TraceLab 显示长上下文读取主导服务成本,Securing Agentic Identity 则让可复用 OAuth token 留在智能体运行时之外。