更广泛的编码智能体评测
ICAE-Bench 测试智能体能否澄清不完整的需求并构建代码仓库,而不是解决一个规格完整的编辑任务。其 480 个任务覆盖 12 种语言;在两个 harness 中评测的六个模型仍难以处理隐藏约束、边界情况和长周期集成。
Tencent WorkBuddy Bench 将评测扩展到代码、网页、办公和安全工作。其 260 个任务经过逆向工程和重写,以减少通过网页搜索找回答案的可能性,随后随环境和验证器一同发布,以支持可审计性。由于每个领域采用不同的验证方法,该套件有意不提供单一的聚合分数。总体而言,这些基准表明,任务构造和评估器设计本身就是能力主张的一部分,而不是背景实现细节。