轨迹级智能体评估
智能体评估正在更偏向可操作的证据。ProcGrep 将编码智能体轨迹转换为文件读取、仓库搜索、编辑、测试和提交等动作序列。在 SWE-bench Verified 轨迹上,它的过程指纹能以 85.7% 的准确率把未见过的轨迹归因到正确智能体;在报告的 episodic-search 任务中,它的确定性轨迹搜索优于 LLM 裁判。
SWE-Future 处理另一个评估弱点:公开 GitHub issue 和 pull request 的重放。它根据快照前证据预测未来仓库任务族,用后续 pull-request 元数据验证这些任务族,再合成可执行任务。每日趋势证据还给出一个实际提醒:同一模型在另一个智能体 harness 下可能得到不同分数,因此基准声明需要说明所用 harness。