机器人策略中的世界模型
一些论文把未来状态预测用作训练信号,或把它纳入动作选择。WLA 在一个策略里同时预测文本子任务、紧凑的物理过渡和一个动作块。它的世界建模损失有可测影响:去掉后,RoboTwin Clean 成功率从 92.94% 降到 90.98%,LIBERO 平均成功率从 98.6% 降到 97.9%。
同样的思路也出现在桌面操作之外。WorldFly 把未来视频潜变量和导航动作结合起来,用于低空无人机控制。在 Urban Canyon Traversal 基准上,它在见过的路口达到 87% 成功率,在更难的未见路口达到 31%,在报告指标上超过 OpenFly 和 Pi-0-UAV。DexFuture 用预测的未来手-工具-物体目标做双手工具使用,运行速度为 60 Hz,避免了对高维手部动作进行缓慢的在线规划。