面向机制的长时程评测
LongBench 为这一时期提供了一个具体锚点:长时程机器人评测开始更明确地解释策略为什么会失败。这个基准覆盖 10 个真实世界任务和 1,000 多个 episode。它把完全可观测的执行问题和依赖上下文的歧义分开,再按阶段给进展评分,而不是只给一个通过或失败的数字。这很重要,因为当前策略的失效原因各不相同。在上下文无关任务上,pi_0 以 86.3 的平均阶段评分领先,Diffusion Policy 为 51.2,OpenVLA-OFT 为 32.7。动态抓取是最清楚的压力测试。pi_0 得到 73.3,其他列出的系统都在 0.0 到 13.3 之间。