---
kind: ideas
granularity: day
period_start: '2026-07-06T00:00:00'
period_end: '2026-07-07T00:00:00'
run_id: materialize-outputs
status: succeeded
topics:
- robot manipulation
- vision-language-action models
- world models
- long-horizon control
- sim-to-real
- deformable objects
tags:
- recoleta/ideas
- topic/robot-manipulation
- topic/vision-language-action-models
- topic/world-models
- topic/long-horizon-control
- topic/sim-to-real
- topic/deformable-objects
language_code: zh-CN
---

# 面向部署的机器人策略适配

## 摘要
相机移动、长时程任务状态和目标场景数据，是机器人策略落地的具体障碍。证据支持三项实际改进：在小幅相机偏移下测试 VLA 策略，为长时程任务设置带记忆的受约束子任务接口，并在采集远程操作数据之前，根据单张场景图像生成目标场景示范数据。

## VLA 部署的相机偏移压力测试
机器人团队应在将 VLA 用于原始实验室环境之外之前，加入相机偏移测试。CamVLA 清楚展示了这种失效模式：针对单一相机视角训练的策略在相机发生小幅旋转后，成功率可能大幅下降，因为模型根据相机视角图像预测机器人基座坐标系中的动作，却没有显式估计手眼关系。

实际检查很简单。在训练时的相机位姿下运行同一套操作任务，然后重新安装或轻推相机，使其产生 5°、10° 和 15° 的偏移，再次运行。记录成功率、手眼误差和增加的推理延迟。CamVLA 提供了具体的修正路径：在相机坐标系中预测末端执行器动作，根据一张 RGB 图像估计相机到机器人的 6-DoF 变换，再将动作转换到机器人基座坐标系。

这项改进的价值在于运行可靠性。在真实 Franka 测试中，π0 + CamVLA 在所有测试偏移下的成功率都高于单独使用 π0，几何头在 RTX 4090 上增加的延迟约为 1 ms。对于相机会被碰动、在工作站之间移动或安装在移动设备上的团队，这一开销足够小，可以将测试纳入部署防护措施。

### 资料来源
- Document 797: CamVLA 报告了相机位姿导致的失效模式、相机坐标系动作与 6-DoF 手眼估计方法、Franka 上的偏移测试结果以及增加的延迟。
- Document 797: 摘要说明了部署问题：真实相机设置在训练后经常发生变化，而以往的视角容错方法需要显式外参。

## 面向长时程机器人工作的受约束子任务接口
长时程机器人任务需要带记忆的可执行子任务接口，尤其适用于实验室流程、清洗、分拣和家庭物品处理等工作。Cortex 和 DSWAM 指向同一种实用模式：保留用于控制的低层动作策略，再由上层规划器发出执行器能够完成的指令。

Cortex 提供了清晰的实现模板。它的规划器维护文本记忆，使用 32 个标准操作原语，并通过模板和带可达性信息的标注约束输出。采用者应在扩大任务覆盖范围之前先编写接口：列出允许使用的原语，定义物体属性和空间指代，并拒绝 VLA 无法执行的规划器输出。

评估应使用完整任务回合，不能只看逐步模仿。Cortex 在真实世界的 14 步化学任务上报告了 65% 的成功率，在 14 步清洗任务上报告了 55% 的成功率，而文中引用的端到端基线得分为 0%。对于双臂工作，DSWAM 还给出了部署细节：采用异步执行、实时分块和 BF16 TensorRT 加速，避免策略查询中断机器人控制。

### 资料来源
- Document 799: Cortex 描述了记忆、受约束的 32 原语接口、带可达性信息的标注，以及真实世界 14 步化学和清洗任务的结果。
- Document 806: DSWAM 描述了可选的视觉语言子任务规划器、WAM 执行器、异步执行、实时分块，以及真实折叠任务中相当的结果。

## 基于单张图像生成目标场景机器人示范
将预训练机器人策略适配到特定厨房、工作台或货架的团队，应在开始大规模远程操作采集之前，先测试与目标场景匹配的合成示范数据。PRISM 给出了具体流程：获取一张目标场景图像和一条指令，检测物体，检索相似的 3D 资产，构建任务关系相同但存在变化的模拟场景，规划动作，并使用生成的轨迹进行训练。

当任务已知但部署场景不同于预训练数据时，这种方法最有用。一项成本较低的验证方式是选择两个固定任务，为每个任务生成 400 条轨迹，微调策略，再与通用模拟数据和少量远程操作数据进行比较。PRISM 报告的仿真到仿真结果足以支持这项检查：在“Put milk in basket”任务上使用 π0.5 时，LIBERO 上的成功率达到 98.0%，而 X-Sim 为 48.0%，RoboTwin 2.0 为 14.0%。

实现中的关键是围绕目标场景加入变化。PRISM 的消融实验说明了原因：“digital cousin”设置在目标环境和变体环境中的得分都是 80.0%，而更接近目标的“digital twin”设置在目标环境中达到 100.0%，在变体环境中只有 30.0%。对于真实部署，这意味着在创建数据时生成合理的场景变体、光照变化、物体位姿、纹理和干扰物。

### 资料来源
- Document 807: PRISM 描述了基于单张图像生成场景匹配数据集、物体检测、资产检索、TAMP 规划、400 条轨迹评估和消融实验。
- Document 807: 摘要说明了目标环境数据问题，以及 PRISM 基于单张图像和指令的流程。
