World models for staged manipulation
HarmoWAM 将操作视为一个依赖阶段的控制问题。一个视频世界模型预测未来帧,两个动作专家分别处理任务的不同部分:一个反应式专家负责移动,一个预测式专家负责精细交互。一个学习到的门控在推理时选择专家。
论文报告了在六个真实世界任务上的测试,任务包含背景、位置和物体变化。在分布外设置下,HarmoWAM 声称相较于先前的 VLA 模型平均提升 33 个百分点,相较于先前的 World Action Models 提升 29 个百分点。关键细节是把到达控制和接触控制分开,论文在动机研究中直接测量了这一点。