依赖工具编排框架的评估
AgentCompass 将基准、工具编排框架和执行环境分离开来,并显示同一模型的结果会随工具编排框架而变化。在 SWE-bench-Pro 上,Claude-Opus-4.8 使用 Mini-SWE-agent 得分 66.21,使用 OpenHands 得分 73.87。另一项集合转换基准发现,智能体会很快形成重复的工具使用流程,并可能在后端静默更换后继续使用不可靠的工具组。这些研究共同表明,交互历史和工具编排配置应被视为测量能力的一部分,而不是无关紧要的测试基础设施。