World-action models for manipulation
Vision-Language-Action(VLA)策略正在围绕预测的 3D 结构和未来接触来构建。STARRY 将未来的时空潜变量和动作联合去噪,然后用预测深度和末端执行器几何来把注意力偏向把手、开口、接触面和附近障碍物。它在 50 个 RoboTwin 2.0 双臂任务上报告了 93.82% 的 clean 成功率和 93.30% 的 randomized 成功率,在真实 ARX R5 实验中,3 个任务的平均成功率为 70.8%。
X-WAM 走的是更宽的 world-action 路线。它在一个扩散模型里同时预测多视角 RGB-D 视频、机器人状态和 32 个未来动作。它的异步去噪调度让动作比视频用更少步数解码,这对闭环控制很重要。论文报告了 RoboCasa 上 79.2% 的平均成功率,以及 RoboTwin 2.0 Randomized 上 90.7% 的成功率,同时也评估了视觉和几何预测指标。