冻结 VLA 策略的测试时动作块选择
使用分块 VLA 策略的机器人团队,可以在执行时加入选择器,用于小误差会破坏整段执行的任务,例如插入、堆叠和抽屉操作。DREAM-Chunk 给出了一种具体做法:从冻结策略中采样多个动作块,用小型潜在世界模型预测每个动作块的未来状态,然后执行那个预测状态与观测到的执行轨迹最匹配的动作块中的动作。论文报告的硬件结果足以支持一次实验室复现检查:在外部扰动下的精密插入任务中,π0.5 的成功率从开环的 10% 提高到使用 DREAM-Chunk 后的 65%。一个相关的 residual-RL 结果给出了另一条低延迟修正路径:一个在仿真中训练的 2 层、基于位姿的残差策略,把真实 FR3 在五个桌面任务上的成功率从 42% 提高到 76%,同时每次 GPU 前向只增加约 0.06 ms,相比一次约 140 ms 的 VLA 调用开销很小。一个实际的首轮测试是只在少数容易失败的任务上运行选择器或残差策略,并比较注入位姿偏移、物体轻推和夹爪遮挡后的恢复情况。