从视频规划到低层操作控制的带门控切换
一个实用的机器人系统现在更像是在控制边界上拆成模块:先用视频模型生成接近路径,再把接触和恢复交给反应式 VLA 策略。Veo-Act 给出了这种拆分最清楚的例子。它把 Veo-3 规划器和低层 VLA 策略结合起来,在测试的仿真和真实操作设置里把平均成功率从 45% 提到 80%,在歧义场景和经过式交互上的提升尤其大。在真实的经过式交互中,成功率从 2/13 提到 11/13。论文也直接指出了边界:视频预测可以画出动作轨迹,但单靠动作恢复,精度还是不够,难以稳定完成高接触任务。
这里真正可落地的做法,是在轨迹提议器和你已经信任的近物体动作策略之间加一层带门控的切换层。做灵巧抓放、杂乱桌面操作,或者视角别扭的移动操作的团队,可以在不重训完整端到端规划器的情况下先试这个方案。可以先挑一类失败模式,比如当前策略在有干扰物或视野不完整时选错接近方式。记录机器人该继续沿计划路径前进,什么时候该切到反应式控制器,再看这种切换是否能提高任务完成率,同时不引入危险接触。真正的部署难点不只是模型质量,而是切换逻辑,以及规划器粗粒度未来和控制器动作块格式之间的接口。