---
kind: trend
trend_doc_id: 825
granularity: day
period_start: '2026-07-07T00:00:00'
period_end: '2026-07-08T00:00:00'
topics:
- "\u673A\u5668\u4EBA\u5B66"
- "\u89C6\u89C9\u8BED\u8A00\u52A8\u4F5C\u6A21\u578B"
- "\u4E16\u754C\u6A21\u578B"
- "3D \u64CD\u4F5C"
- "\u6A21\u4EFF\u5B66\u4E60"
- "\u7075\u5DE7\u64CD\u4F5C"
- "\u673A\u5668\u4EBA\u89C4\u5212"
run_id: materialize-outputs
aliases:
- recoleta-trend-825
tags:
- recoleta/trend
- "topic/\u673A\u5668\u4EBA\u5B66"
- "topic/\u89C6\u89C9\u8BED\u8A00\u52A8\u4F5C\u6A21\u578B"
- "topic/\u4E16\u754C\u6A21\u578B"
- "topic/3d-\u64CD\u4F5C"
- "topic/\u6A21\u4EFF\u5B66\u4E60"
- "topic/\u7075\u5DE7\u64CD\u4F5C"
- "topic/\u673A\u5668\u4EBA\u89C4\u5212"
language_code: zh-CN
---

# 机器人策略研究正集中于几何结构、生成式示范和控制延迟

## 概览
当天的机器人论文将物理细节纳入策略流程。视觉语言动作（VLA）模型加入 3D 结构、可复用示范、缓存动作块和明确的交接检查。RynnWorld-4D、RynnWorld-Teleop 和 Lift3D-VLA 的重点最清晰：让机器人控制更快、更具空间依据，同时减少对原始物理数据采集的依赖。

## 研究发现

### 用于操作和遥操作的 4D 世界模型
RynnWorld-4D 将未来预测统一为 RGB、深度和光流。深度信息将像素提升为 3D 点，光流则按时间连接这些点，使策略能够从场景流角度理解接触和运动。在这一时期的报告中，数据规模很大：Rynn4DDataset 1.0 包含超过 2.544 亿帧。策略路径在 RTX 5090 上每次规划仍需 1,106 毫秒，其中世界模型耗时 990 毫秒，因此延迟仍是核心限制。

RynnWorld-Teleop 使用动作条件视频模型作为数据引擎。操作者的手部姿态驱动以机器人为中心的第一视角视频，生成的数据集将视频帧与双臂和灵巧手的 54 维机器人动作配对。蒸馏模型在一张 H100 上达到 40+ FPS，使交互式生成成为可能。论文声称使用生成数据可以实现零样本 sim-to-real 迁移，但现有摘录没有给出成功率表。

### VLA 策略中的 3D 几何
Lift3D-VLA 在复用预训练 2D 视觉编码器的同时，为 VLA 策略加入点云推理。它将 3D 点投影到六个虚拟平面上，把 1024 个点标记化为 256 个 token，并训练编码器重建当前几何结构、预测下一帧几何结构。动作解码器还将动作块预测分散到 LLaMA2-7B 的各层中。

报告中的提升幅度很明确：MetaWorld 平均成功率提高 10.8 个百分点，RLBench 提高 11.1 个百分点，相比摘录中最强的真实世界基线提高 4 个百分点。这一组结果表明，当天关于操作性能的最强结论都与可达性、遮挡、接触和未来几何结构有关，不能只依靠语言条件图像特征。

### 高效的 VLA 训练与推理
ActionCache 通过复用过去的动作块，降低基于流的 VLA 模型的推理成本。系统使用紧凑键检索缓存动作，然后直接执行，或用一到两步流计算进行细化。在使用 π0.5 的 VLABench 上，完整模型的成功率为 38.8%，动作头延迟为 18.8 毫秒；不进行细化时，ActionCache 的成功率为 32.9%，延迟为 1.6 毫秒。进行一步细化后，成功率为 32.4%，延迟为 3.6 毫秒；直接进行一步生成时，成功率降至 6.8%。

SIEVE 处理训练环节。它根据夹爪或手部状态变化切分示范数据，聚类可复用的视觉运动原语，并在原语序列分桶中选择中心轨迹。在使用 Qwen3-VL-4B-GR00T 的 Bridge-V2 上，使用 50% 的示范数据和 25K 步训练，平均成功率达到 56.3%；完整数据训练使用 50K 步，成功率为 51.8%。这些结果表明，选择和复用数据可以提升机器人策略质量，无需扩大每个数据集和每次前向计算的规模。

### 部署失败暴露出薄弱的技能边界
BEHAVIOR-1K 的交接研究说明，单项技能得分高，并不能保证机器人在长时程任务中取得成功。多项独立技能的得分很高，例如 pick_up_from 为 96.5%，place_on 为 100.0%，但端到端任务谓词成功率被描述为接近零。在 30 次 rollout 中，平均进度为 19.5%。一段包含 10 次 rollout 的轨迹记录了 130 次失败的技能尝试，问题包括抓取控制、放置、目标定位和导航准备。

LAMP 为真实硬件提供了另一条路径：利用学习得到的 2D 潜在运动先验，限制灵巧手的探索。在仅使用少量示范数据的情况下，系统在四个真实机器人任务上的模仿学习平均成功率达到 56.25%，在线强化学习后的最终平均成功率达到 98.75%。消融结果差异明显：移除低维瓶颈后，最终成功率降至 55.0%；经过强化学习后，原始行为克隆的平均成功率为 3.75%。
