粗到细的动作生成
两篇操作论文把动作结构当作控制问题来处理。Libra-VLA 把预测拆成离散的宏方向意图和连续的精细控制,然后通过意图缓冲区让更重的规划器降低运行频率。它在 LIBERO 上的平均成功率是 97.2%,在 LIBERO-Plus 上的零样本成功率是 79.5%。
CF-VLA 把类似的粗到细思路用于基于流的动作采样。它只做两次函数评估:一次粗粒度、感知动作的起点,一次局部修正。报告的权衡很明确:在 NFE=2 时,LIBERO 平均成功率是 96.5%,动作采样延迟降低 75.4%,真实机器人实验中的平均成功率是 83.0%。