在线 VLA 适配
多篇论文把部署当作学习循环。SARL 将语言提示作为语义动作来训练,然后用奖励学习哪些提示能产生有用的机器人行为。在 Libero-10 和四个真实 WidowX 任务上,论文报告单一任务提示下的初始成功率接近 0%,经过 60 到 100 个在线 episode 后成功率约为 80%。
Z-1 在监督微调后,对基于 flow 的 VLA 策略应用强化学习。在 24 个 RoboCasa 任务上,其平均成功率从监督微调后的 67.4% 提高到 group relative policy optimization 后的 80.6%。最强的受控结论是相对作者自身初始化提高 13.2 个百分点,因为部分外部比较使用了既有工作的报告数值。
一项剪枝研究补充了部署成本视角。它使用 VLM 到 VLA 适配过程中的权重变化,判断 OpenVLA 和 pi_0.5 的哪些组件可以移除。报告目标是在不进行剪枝后恢复的情况下,减少 12% 到 30% 参数,同时保持约 90% 的原始 LIBERO 性能。