Predictive world models for moving scenes and data growth
几篇论文把预测当作机器人策略中缺失的控制层。AHEAD 在冻结的 7B OpenVLA 模型外包上一层 490 万参数的潜在世界模型,用来预测与任务相关的未来视觉 token。它的提升在物体运动带来时序问题时最明显:在 20 个动态仿真场景中,成功率为 79% 到 97%;在实体 xArm 7 上的抛接任务中为 19/30,而列出的所有基线都是 0/30。
RoboDream 解决的是另一个瓶颈:示范数据供给。它先把视频扩散锚定到只包含机器人运动的渲染结果,再补入物体和场景。混合真实数据和生成数据后,四个操作任务上的平均真实世界成功率达到 62.5%,而 Real-50 基线为 36.3%。在报告的设置里,扩大混合数据后成功率达到 72.5% 到 73.75%。