相机移动、长时程任务状态和目标场景数据,是机器人策略落地的具体障碍。证据支持三项实际改进:在小幅相机偏移下测试 VLA 策略,为长时程任务设置带记忆的受约束子任务接口,并在采集远程操作数据之前,根据单张场景图像生成目标场景示范数据。

3 个想法

VLA 部署的相机偏移压力测试

机器人团队应在将 VLA 用于原始实验室环境之外之前,加入相机偏移测试。CamVLA 清楚展示了这种失效模式:针对单一相机视角训练的策略在相机发生小幅旋转后,成功率可能大幅下降,因为模型根据相机视角图像预测机器人基座坐标系中的动作,却没有显式估计手眼关系。

实际检查很简单。在训练时的相机位姿下运行同一套操作任务,然后重新安装或轻推相机,使其产生 5°、10° 和 15° 的偏移,再次运行。记录成功率、手眼误差和增加的推理延迟。CamVLA 提供了具体的修正路径:在相机坐标系中预测末端执行器动作,根据一张 RGB 图像估计相机到机器人的 6-DoF 变换,再将动作转换到机器人基座坐标系。

这项改进的价值在于运行可靠性。在真实 Franka 测试中,π0 + CamVLA 在所有测试偏移下的成功率都高于单独使用 π0,几何头在 RTX 4090 上增加的延迟约为 1 ms。对于相机会被碰动、在工作站之间移动或安装在移动设备上的团队,这一开销足够小,可以将测试纳入部署防护措施。

  • Document 797

面向长时程机器人工作的受约束子任务接口

长时程机器人任务需要带记忆的可执行子任务接口,尤其适用于实验室流程、清洗、分拣和家庭物品处理等工作。Cortex 和 DSWAM 指向同一种实用模式:保留用于控制的低层动作策略,再由上层规划器发出执行器能够完成的指令。

Cortex 提供了清晰的实现模板。它的规划器维护文本记忆,使用 32 个标准操作原语,并通过模板和带可达性信息的标注约束输出。采用者应在扩大任务覆盖范围之前先编写接口:列出允许使用的原语,定义物体属性和空间指代,并拒绝 VLA 无法执行的规划器输出。

评估应使用完整任务回合,不能只看逐步模仿。Cortex 在真实世界的 14 步化学任务上报告了 65% 的成功率,在 14 步清洗任务上报告了 55% 的成功率,而文中引用的端到端基线得分为 0%。对于双臂工作,DSWAM 还给出了部署细节:采用异步执行、实时分块和 BF16 TensorRT 加速,避免策略查询中断机器人控制。

  • Document 799
  • Document 806

基于单张图像生成目标场景机器人示范

将预训练机器人策略适配到特定厨房、工作台或货架的团队,应在开始大规模远程操作采集之前,先测试与目标场景匹配的合成示范数据。PRISM 给出了具体流程:获取一张目标场景图像和一条指令,检测物体,检索相似的 3D 资产,构建任务关系相同但存在变化的模拟场景,规划动作,并使用生成的轨迹进行训练。

当任务已知但部署场景不同于预训练数据时,这种方法最有用。一项成本较低的验证方式是选择两个固定任务,为每个任务生成 400 条轨迹,微调策略,再与通用模拟数据和少量远程操作数据进行比较。PRISM 报告的仿真到仿真结果足以支持这项检查:在“Put milk in basket”任务上使用 π0.5 时,LIBERO 上的成功率达到 98.0%,而 X-Sim 为 48.0%,RoboTwin 2.0 为 14.0%。

实现中的关键是围绕目标场景加入变化。PRISM 的消融实验说明了原因:“digital cousin”设置在目标环境和变体环境中的得分都是 80.0%,而更接近目标的“digital twin”设置在目标环境中达到 100.0%,在变体环境中只有 30.0%。对于真实部署,这意味着在创建数据时生成合理的场景变体、光照变化、物体位姿、纹理和干扰物。

  • Document 807