趋势

机器人 VLA 工作正集中于可部署的控制机制

日 · 2026-06-18 · Embodied AI

当天的研究主要集中在机器人。视觉-语言-动作(VLA)论文关注如何让策略成本更低、更理解几何,并能更安全地在硬件上运行。EquiVLA、CLP 和 Qwen-RobotWorld 给出主要方向:实际控制增益需要动作头、训练循环和预测模型中的结构。

结构化动作生成

几篇论文把控制结构加入策略输出内部,没有把机器人动作当作扁平向量处理。EquiVLA 在冻结的视觉-语言骨干和流匹配动作头中加入旋转等变性,在 LIBERO 相对控制上达到 92.6% 平均成功率,在五个 Mobile ALOHA 真实机器人任务上达到 72% 平均成功率。Co-VLA 将双臂动作分成共享协调潜变量和每条手臂的残差潜变量;它报告的最大增益来自 Handover Block Easy:成功率 91%,π0 基线为 64%。FAFM 预测连续轨迹的频率系数,用于处理混合控制频率,并在不增加网络参数的情况下让运动更平滑。

更低成本的适配和有针对性的数据修复

效率收益有具体数字。CLP 在微调前剪除冗余层,并保留原始训练目标。在 LIBERO 上的 π0、GR00T-N1.5 和 SmolVLA 三个模型中,它将模型大小减少 21.3% 到 25.9%,将可训练参数减少 25.8% 到 37.0%,并降低三种模型在 RTX 4070 上的推理延迟。Pose6DAug 处理另一个瓶颈:失败对象。它把新的 3D 对象换入成功的多视角机器人 episode,同时保留 6D 位姿和接触几何。在 RoboCasa365 Counter-to-Cabinet 失败 episode 上,它报告的平均成功率为 22.8%,VACE 为 16.4%,MimicGen 为 15.8%。

具身世界模型需要基于动作的检查

世界模型论文把预测质量当作控制问题处理。Qwen-RobotWorld 使用语言作为共享动作接口,在操作、驾驶、导航和人到机器人场景中预测未来视频;它用 8.6M 个视频-文本样本和超过 200M 帧训练。Reward as An Agent 增加一个基于 VLM 的评估器,评估视觉质量、指令遵循、物理合规性和任务完成情况,然后在 RL 后训练期间使用动态区域探索。Sensorimotor World Models 采用较小规模的路线:用逆动力学正则化潜变量预测,使学到的状态保留与动作相关的变量,并丢弃干扰项。

运行时验证正在成为机器人学习的一部分

安全和自动化论文把检查放进循环中。Tri-Info 根据近期状态和动作嵌入上的熵与互信息预测 VLA rollout 失败。它报告在 sim-to-real 迁移下的真实世界任务准确率为 83%,并给出与动作多样性、时间一致性或弱状态-动作耦合相关的警报。ENPIRE 为真实机器人上的编码 agent 提供重置、rollout、验证和代码编辑 API。论文报告在灵巧任务上的成功率最高为 99%,并显示 8 个机器人-agent worker 并行运行时改进更快。Slow Brain, Fast Planner 将同样的实用逻辑用于导航:一个慢速视觉-语言模型在快速规划器轨迹中做选择,延迟到达的选择会融合进实时规划器分数。

较新代理产品宣传控制能力的速度快于公开证据较早编码代理需要经过失败测试的指导和带关卡的执行