---
kind: trend
trend_doc_id: 811
granularity: day
period_start: '2026-07-06T00:00:00'
period_end: '2026-07-07T00:00:00'
topics:
- robot manipulation
- vision-language-action models
- world models
- long-horizon control
- sim-to-real
- deformable objects
run_id: materialize-outputs
aliases:
- recoleta-trend-811
tags:
- recoleta/trend
- topic/robot-manipulation
- topic/vision-language-action-models
- topic/world-models
- topic/long-horizon-control
- topic/sim-to-real
- topic/deformable-objects
language_code: zh-CN
---

# 机器人策略正在加入明确的前瞻、几何信息与任务记忆

## 概览
当天的研究主要集中在机器人操作，并让策略内部状态更加明确：未来状态、潜在动作、相机位姿和子任务记忆。InternVLA-A1.5、Cortex 和 CamVLA体现了当前重点：保持语言条件控制的速度，同时加入长时程、复杂任务所需的物理或时间信号。

## 研究发现

### 潜在前瞻与动作编码
多篇论文训练视觉-语言-动作模型（VLA），让策略内部携带紧凑的动作相关信号。InternVLA-A1.5 使用 50 个前瞻 token，在训练期间以这些 token 作为冻结视频生成器的条件；推理时移除视频分支，并输出包含 50 步的连续动作块。CAC-VLA 根据图像和语言 token 预测潜在动作，再通过门控交叉注意力用这些动作作为连续动作专家的条件。GeoMoLa 采用更偏几何的方法：通过预测未来点云变化学习离散运动编码，再用这些编码执行 6-DoF 操作。

当任务要求泛化，而不只是模仿时，报告的收益最大。CAC-VLA 在 LIBERO 上报告了 98.3% 的平均成功率，在 LIBERO-Plus 监督微调中达到 89.5%。GeoMoLa 在单视角 RLBench 的 10 个任务和 166 个变体上报告了 84.7% 的平均成功率，高于 RVT2 的 80.4%。InternVLA-A1.5 声称在六个仿真基准上取得总体最佳结果，但现有摘录没有提供准确的基准表格。

### 受限子任务下的长时程控制
长时程任务采用了明确的子任务状态和受限技能词表。Cortex 使用高层视觉-语言模型维护文本记忆，并为低层 VLA 发出子任务。它的规划器限制在 32 个标准操作原语内，并配有模板和感知可达性的标注，使低层策略能够接收可执行命令。

DSWAM 采用了类似的分工。默认路径由 World Action Model 执行器完成，预测双臂动作块；当粗粒度的家庭操作指令需要拆分时，再启用视觉-语言规划器。在匹配 DeMaVLA 设置的真实折叠测试中，DSWAM 将成功率从 92.5% 提高到 96.3%，并将平均完成时间从 2'18" 缩短到 1'44"。Cortex 在 14 步真实化学任务上的成功率为 65%，在 14 步洗涤任务上的成功率为 55%；引用的端到端基线在这两类任务上的成功率均为 0%。

### 部署缺口：相机位姿与场景专用数据
两篇论文针对训练好的策略离开原始设置后出现的问题。CamVLA 处理相机移动。它在相机坐标系中预测末端执行器动作，根据一张 RGB 图像估计 6-DoF 手眼变换，再将动作转换到机器人基座坐标系。在 RLBench 未见过的视角上，加入 CamVLA 后，π0 的平均成功率从 33.2% 提高到 51.4%。在真实 Franka 测试中，π0 + CamVLA 在 5°、10° 和 15° 的相机偏移下也保持了更高的成功率。

PRISM 处理缺少与场景匹配的示范数据这一问题。它根据一张目标场景图像和一条指令生成多样的模拟“数字表亲”场景，规划轨迹，并使用生成的数据训练策略。在每个任务使用 400 条轨迹的仿真到仿真测试中，使用 π0.5 时，PRISM 在 LIBERO 的 “Put milk in basket” 任务上达到 98.0%，而 X-Sim 为 48.0%，RoboTwin 2.0 为 14.0%。

### 可变形物体世界模型需要触觉与密集 3D 跟踪
Deform360 为同一控制问题加入了数据规模较大的研究方向。它使用 41 台同步相机和配备触觉传感器的夹爪，采集了 198 个可变形物体和 1,980 条交互序列。数据集包含布状、绳状和体积状物体，涵盖 17 个类别中的 13 种操作原语。

它的主要贡献是配对传感。该流程重建每帧几何结构，在每个视角跟踪最多 1,600 个点，将轨迹提升到 3D 空间，再利用触觉接触一致性进行细化。摘要报告称，视觉触觉跟踪的 Chamfer 距离误差为 2.71×10^-5 m²，纯视觉跟踪为 1.41×10^-4 m²。视觉到接触预测在 36 个筛选视角上的平均准确率达到 88.67%。这为未来的机器人世界模型提供了一个用于接触密集型可变形物体操作的具体基准。
