任务记忆与未来状态推理
为策略提供明确的任务进度状态。TFP维护连续时间的潜在信念,使LIBERO Long-10的成功率从92.4%升至97.0%;在真实物体交换任务中,成功率从3/20升至15/20。Harness VLA围绕冻结控制器配置记忆引导规划器,使用已存储的轨迹、重新定位、分阶段执行和重试。在LIBERO-Pro上,它达到82.4%,而直接使用冻结控制器的基线为50.0%。LEEVLA在训练期间加入任务相关区域加权和潜在未来特征预测,在LIBERO上达到98.2%的平均成功率,且推理时无需额外记忆或计算。