用于操作和遥操作的 4D 世界模型
RynnWorld-4D 将未来预测统一为 RGB、深度和光流。深度信息将像素提升为 3D 点,光流则按时间连接这些点,使策略能够从场景流角度理解接触和运动。在这一时期的报告中,数据规模很大:Rynn4DDataset 1.0 包含超过 2.544 亿帧。策略路径在 RTX 5090 上每次规划仍需 1,106 毫秒,其中世界模型耗时 990 毫秒,因此延迟仍是核心限制。
RynnWorld-Teleop 使用动作条件视频模型作为数据引擎。操作者的手部姿态驱动以机器人为中心的第一视角视频,生成的数据集将视频帧与双臂和灵巧手的 54 维机器人动作配对。蒸馏模型在一张 H100 上达到 40+ FPS,使交互式生成成为可能。论文声称使用生成数据可以实现零样本 sim-to-real 迁移,但现有摘录没有给出成功率表。