趋势

机器人策略研究正集中于几何结构、生成式示范和控制延迟

日 · 2026-07-07 · Embodied AI

当天的机器人论文将物理细节纳入策略流程。视觉语言动作(VLA)模型加入 3D 结构、可复用示范、缓存动作块和明确的交接检查。RynnWorld-4D、RynnWorld-Teleop 和 Lift3D-VLA 的重点最清晰:让机器人控制更快、更具空间依据,同时减少对原始物理数据采集的依赖。

用于操作和遥操作的 4D 世界模型

RynnWorld-4D 将未来预测统一为 RGB、深度和光流。深度信息将像素提升为 3D 点,光流则按时间连接这些点,使策略能够从场景流角度理解接触和运动。在这一时期的报告中,数据规模很大:Rynn4DDataset 1.0 包含超过 2.544 亿帧。策略路径在 RTX 5090 上每次规划仍需 1,106 毫秒,其中世界模型耗时 990 毫秒,因此延迟仍是核心限制。

RynnWorld-Teleop 使用动作条件视频模型作为数据引擎。操作者的手部姿态驱动以机器人为中心的第一视角视频,生成的数据集将视频帧与双臂和灵巧手的 54 维机器人动作配对。蒸馏模型在一张 H100 上达到 40+ FPS,使交互式生成成为可能。论文声称使用生成数据可以实现零样本 sim-to-real 迁移,但现有摘录没有给出成功率表。

VLA 策略中的 3D 几何

Lift3D-VLA 在复用预训练 2D 视觉编码器的同时,为 VLA 策略加入点云推理。它将 3D 点投影到六个虚拟平面上,把 1024 个点标记化为 256 个 token,并训练编码器重建当前几何结构、预测下一帧几何结构。动作解码器还将动作块预测分散到 LLaMA2-7B 的各层中。

报告中的提升幅度很明确:MetaWorld 平均成功率提高 10.8 个百分点,RLBench 提高 11.1 个百分点,相比摘录中最强的真实世界基线提高 4 个百分点。这一组结果表明,当天关于操作性能的最强结论都与可达性、遮挡、接触和未来几何结构有关,不能只依靠语言条件图像特征。

高效的 VLA 训练与推理

ActionCache 通过复用过去的动作块,降低基于流的 VLA 模型的推理成本。系统使用紧凑键检索缓存动作,然后直接执行,或用一到两步流计算进行细化。在使用 π0.5 的 VLABench 上,完整模型的成功率为 38.8%,动作头延迟为 18.8 毫秒;不进行细化时,ActionCache 的成功率为 32.9%,延迟为 1.6 毫秒。进行一步细化后,成功率为 32.4%,延迟为 3.6 毫秒;直接进行一步生成时,成功率降至 6.8%。

SIEVE 处理训练环节。它根据夹爪或手部状态变化切分示范数据,聚类可复用的视觉运动原语,并在原语序列分桶中选择中心轨迹。在使用 Qwen3-VL-4B-GR00T 的 Bridge-V2 上,使用 50% 的示范数据和 25K 步训练,平均成功率达到 56.3%;完整数据训练使用 50K 步,成功率为 51.8%。这些结果表明,选择和复用数据可以提升机器人策略质量,无需扩大每个数据集和每次前向计算的规模。

部署失败暴露出薄弱的技能边界

BEHAVIOR-1K 的交接研究说明,单项技能得分高,并不能保证机器人在长时程任务中取得成功。多项独立技能的得分很高,例如 pick_up_from 为 96.5%,place_on 为 100.0%,但端到端任务谓词成功率被描述为接近零。在 30 次 rollout 中,平均进度为 19.5%。一段包含 10 次 rollout 的轨迹记录了 130 次失败的技能尝试,问题包括抓取控制、放置、目标定位和导航准备。

LAMP 为真实硬件提供了另一条路径:利用学习得到的 2D 潜在运动先验,限制灵巧手的探索。在仅使用少量示范数据的情况下,系统在四个真实机器人任务上的模仿学习平均成功率达到 56.25%,在线强化学习后的最终平均成功率达到 98.75%。消融结果差异明显:移除低维瓶颈后,最终成功率降至 55.0%;经过强化学习后,原始行为克隆的平均成功率为 3.75%。

较新编码代理需要更安全的输入、受控工具和可重复的生产路径较早代码代理需要验证器、审查器和基于轨迹的修复