趋势

VLA 部署工作同时针对延迟、连续性和稀缺交互数据

日 · 2026-07-14 · Embodied AI

当天的证据将近期对高效机器人学习的关注延伸到了部署环节。视觉-语言-动作(VLA)系统正在围绕推理、控制连续性和数据采集进行优化,而不只是依靠模型规模扩展。现有结果涵盖仿真和有限的真实机器人测试,因此其在广泛实际环境中的可靠性仍未得到证明。

实时 VLA 控制

三篇论文分别针对控制延迟的不同来源。去除时间冗余的方法缓存稳定的视觉令牌,并将流采样压缩为两步;在 LIBERO 上达到 8.2 FPS,平均成功率为 93.8%,而原始策略为 94.4%。Jetson-PI 则预测未来表征,以纠正异步推理中的过时观测;系统优化将 Jetson Orin 的控制频率从 0.70 Hz 提升至 6.06 Hz。ChunkFlow 通过边界感知训练和重叠融合补充原始速度,在 LIBERO-Long 上报告 93.4% 的成功率和 4.43 ms 的推理延迟。综合来看,实用的 VLA 控制取决于视觉感知复用、动作生成、硬件调度和动作块执行之间的协同。

每次交互带来更多学习价值

数据稀缺这一信号仍在延续,但现在出现了主动制造多样性的机制,而不只是增加示范数量。WANDA 将一次 RGBD 示范转换为重建和生成的 3D 场景中的多条轨迹;在仿真中达到 75.6% 的平均成功率,接近使用约 40–60 次示范训练的基线。ExToken 利用行为聚类使强化学习 rollout 多样化:256 次 rollout 达到 93.4% 的成功率,而匹配基线为 90.3%,且性能接近其 512 次 rollout 的设置。FlowWAM 提供了另一条路径:从无动作标注视频中提取的光流,将 RoboTwin Clean 的成功率从 82.40% 提升至 92.94%。

与控制对齐的场景和运动表征

明确的表征设计仍然是效率提升的重要补充。VistaVLA 将语义特征建立在 3D Gaussian 基元上,再将约 100,000 个基元压缩为供策略使用的 64 个令牌。该方法在七项真实世界任务中的平均成功率提升了 22.8 个百分点,但对大幅位置变化的处理仍然困难。FlowWAM 将动作表示为光流视频,使一个预训练视频架构能够同时支持控制和未来预测;在 RoboTwin Clean 和 Random 上分别达到 92.94% 和 92.14% 的成功率。共同结果并不是表明研究普遍转向 3D 或视频表征,而是表明:当表征的坐标系和时间结构与控制问题相匹配时,表征设计才会带来帮助。

较新工具编排选择会改变智能体得分、工具习惯和安全结果较早结构化上下文降低智能体成本,但更快的审查仍伴随质量风险