低延迟动作结构
VLA 论文把动作生成当作控制设计问题来处理。Libra-VLA 将粗粒度离散意图与连续精细控制分开,让规划器以较低频率运行,细化器按控制频率执行。它报告在 LIBERO 上平均成功率为 97.2%,在 LIBERO-Plus 零样本迁移上为 79.5%。
World-action 工作在同一约束下加入未来状态预测。MotuBrain 用一个扩散模型同时预测动作和未来视觉状态,支持多视角,并使用更快的推理栈。报告的延迟从 4.90 秒降至 0.09 秒,频率升至 11.11 Hz。实用结论很直接:预测模型只有适配机器人的更新预算时才有意义。