过时 VLA 动作块的运行时选择
使用分块 VLA 策略的机器人团队可以在现有策略外加一个运行时选择器。选择器采样多个动作块,用一个小型世界模型预测每个动作块的潜在未来状态,并执行预测状态最接近当前观测的那个动作块中的下一步动作。
DREAM-Chunk 在不微调基础策略的情况下测试了这种模式。它针对低频 VLA 控制中的一个常见失效:策略先承诺执行一个动作块,但在滑移、接触误差、部分可观测性或外部扰动之后,后续动作会过时。在外部扰动下的精确插入任务中,论文报告 DREAM-Chunk 的成功率为 65%,开环 π0.5 为 10%。辅助模型也足够小,可以靠近控制环运行:摘要提到一个 15M 参数的 JEPA 世界模型,编码加预测少于 10 ms,而 VLA 推理超过 100 ms。
一个实用的采用测试是封装现有的 π0.5 或 SmolVLA 动作分块设置,在强制姿态偏移和轻微人为扰动下运行相同的插入或抓取任务,并比较成功率、延迟,以及所选候选动作在 rollout 中途发生变化的频率。