动作表征与关键时间步
有几篇论文直接处理动作流本身。RotVLA 将帧间转移编码为连续的 SO(n) 潜在动作,并在训练中对它们进行组合。它在 LIBERO 上报告了 98.2% 的平均成功率,并在预训练超过 1700 小时的机器人和人类视频后,在 RoboTwin2.0 的干净和随机设置上分别达到 89.6% 和 88.5%。
FrameSkip 和 AttenA+ 在数据和损失层面提出了相关主张。FrameSkip 只保留 20% 的独特轨迹帧,并优先保留对齐、接触、夹爪闭合和释放帧。它在 RoboCasa-GR1、SimplerEnv 和 LIBERO 上的宏平均成功率从 66.50% 提升到 76.15%。AttenA+ 给缓慢、精度要求高的动作更高的损失权重,并把 OpenVLA-OFT 在 LIBERO 上的成功率从 97.10% 提升到 98.60%。