长时程操控的结构化执行
长时程机器人控制正在被构建成一个执行系统,而不只是更大的策略。HELM 是最清楚的例子。它加入了情景记忆、执行前的失败检查,以及基于回滚的恢复。在 LIBERO-LONG 上,这把 OpenVLA 从 58.4% 提升到 81.5%。论文还表明,单纯扩大上下文帮助小得多,在 H=32 时只到 63.8%。ST-π 在规划层面推进同样的思路。它预测带有语义意图、目标位置和持续时间的 chunk 级提示,然后把每个 chunk 交给 step 级动作生成器。论文报告的 STAR 数据集也把这种结构写得很清楚,包含 30 个真实世界任务、每个任务 50 个示范,以及约 300k 次交互步骤。