有真实工程约束的智能体基准
大语言模型(LLM)智能体评估正越来越接近完整工程工作。Meta-Agent Challenge 给一个编码智能体提供沙箱、API、开发集和隐藏验证器,然后要求它构建另一个智能体。可见的最佳结果在一些领域大致达到人类基线,但不同模型和任务之间表现差异很大,在科学问答上差距明显。
TeleSWEBench 增加了一个面向领域的压力测试。它从真实的 srsRAN 5G 提交记录中构建 734 个任务,并要求先定位文件,再做功能评分。最强的自动化软件工程工具最高能产出 25% 的可交付修改,而当提示给出的编辑细节减少时,定位率会明显下降。这把瓶颈说得很清楚:仓库规模、协议密集的代码仍然能难住很多当前智能体。