分层规划正在推动长时程操作
长时程操作论文越来越明确地把控制环放在执行器策略之上。HiVLA 把视觉-语言模型(VLM)用于规划和落地,再把执行交给一个扩散策略,同时使用全局场景 token 和高分辨率局部裁剪。这个设置在 RoboTwin 2.0 上的平均成功率为 83.3%,高于 H-RDT 的 70.6%。Goal2Skill 为多阶段任务加入了结构化记忆、后置条件检查和恢复逻辑。在五个 RMBench 任务上,它报告的平均成功率是 32.4%,而最强基线为 9.8%。共同的信息很明确:更好的长时程结果现在来自显式的子任务结构、场景落地和步骤验证,而不只是更大的端到端策略。