闭环代码代理评估
Asuka-Bench 在初始请求含糊、且有多轮用户反馈的条件下评估网页应用代理。这个基准隐藏完整产品需求,测试浏览器渲染后的行为,并把直接的失败反馈带入后续轮次。报告中的差异很大:三轮之后,按权重计算的任务通过率在 13 种模型-运行时配置之间介于 51.8% 到 90.1%。
ADK Arena 把 Agent Development Kits(ADKs)当作可测量的工程选择。一个编码代理在隔离的 Docker 环境里为 51 个 Python kit 构建基准代理。生成在 57% 的运行中成功,成本在不同 kit 之间相差 5.6 倍。单项基准中最好的代理达到 80% 的任务解决率,中位 kit 达到 32%。