VLA 操作微调
VLA 操作论文更看重真实执行指标。EXPO-FT 保留一个预训练的 π0.5 策略,并用离策略强化学习训练一个轻量编辑策略。它报告在 8 个真实世界操作任务上,每个任务都达到 30/30 的最终成功率,平均只用了 19.1 分钟的在线机器人数据。
OASIS 直接处理动作解码问题。它先预测一个 8 步的 SE(3) 末端执行器轨迹,也就是三维位置和旋转,再生成 6-DoF 动作和夹爪指令。论文报告在 LIBERO 上平均成功率为 97.6%,在 Franka Research 3 和 Kinova Gen3 机器人上的真实世界测试平均成功率为 89.2%。