智能体评测触及模糊项目,可靠性机制转移到 harness
在过去几天聚焦于编码循环中的可执行反馈之后,今天的证据拓宽了控制面。新的基准测试智能体处理不完整的产品意图和混合型办公任务;可靠性机制则在预先定义的检查点交付记忆、逻辑推理和审查。结果仍处于早期阶段:几项研究缺乏广泛的量化比较,其中一个工作流虽然提升了可审计性,但成本显著增加。
在过去几天聚焦于编码循环中的可执行反馈之后,今天的证据拓宽了控制面。新的基准测试智能体处理不完整的产品意图和混合型办公任务;可靠性机制则在预先定义的检查点交付记忆、逻辑推理和审查。结果仍处于早期阶段:几项研究缺乏广泛的量化比较,其中一个工作流虽然提升了可审计性,但成本显著增加。
本周的证据把编码智能体视为生产系统。最有力的工作衡量了智能体离开单任务演示后的审查负担、token 支出和权限控制。SWE-INTERACT 让顶尖模型的解决率降到单轮结果的大约一半,TraceLab 显示长上下文读取主导服务成本,Securing Agentic Identity 则让可复用 OAuth token 留在智能体运行时之外。
当天证据最强的研究将大型语言模型(LLM)智能体视为生产系统,这类系统需要任务上下文、可复用流程和安全检查。DeepDiscovery、EnterpriseClawBench 和 AFTER 给出了最清楚的证据,包含具体任务、制品和迁移测试。