面向视角稳健 VLA 的机器人坐标系未来变化量训练
整合不同相机设置下示范数据的 VLA 团队需要能够预测物理后果的策略,同时避免重新学习相机坐标系到机器人坐标系的变换。WALA 通过语义和几何未来变化监督,在 RoboCasa 上提升了 21 个百分点;以机器人为中心的点图让 π₀.₅ 提升了 7.6 个百分点,并在未见过的相机位置下扩大了优势。这些结果表明,应在潜在动作训练前,先用机器人坐标系表达未来几何变化。
增加一个解码器,预测以当前末端执行器为中心的机器人中心点图或其变化量。保留 WALA 的语义目标,并让动作头在同一坐标系下训练。这样,预测的场景变化就能直接对应可执行动作。
进行低数据量测试:使用固定相机训练,在未见过的相机位置下评估。比较深度变化量、相机坐标系点图变化量和机器人坐标系点图变化量三种目标。设定试验决策阈值:如果机器人坐标系目标使未见相机位置下的成功率提升不足 5 个百分点,或使固定相机下的成功率下降超过 3 个百分点,就停止采用该目标。