趋势

机器人策略和世界模型正在接受记忆、接触和动作忠实度的检验

日 · 2026-05-05 · Embodied AI

当天最清楚的信号是具身 AI 受到评测压力。经过几天的 Vision-Language-Action(VLA)部署工作后,这些论文把成功条件放到了记忆、接触感知、动作条件预测和空间一致性上。RLDX-1、RoboAlign-R1 和 iWorld-Bench 提供了最强的证据。

Dexterous VLA policies

RLDX-1 将灵巧操作视为一个多信号控制问题。该策略在基于 Qwen3-VL 的 VLA 上加入了视频运动、小型记忆库,以及触觉或扭矩输入。它的 Multi-Stream Action Transformer 会先把认知、本体感觉和物理三条流分开,再用跨流注意力把它们合并,用于动作预测。

报告中的提升主要出现在当前图像策略难以处理的任务上。RLDX-1 在 ALLEX 人形任务上的成功率为 86.8%,而 π₀.₅ 和 GR00T N1.6 约为 40%。在 ALLEX Object-in-Box Selection 这个对记忆要求很高的任务上,它的成功率为 91.7%,而两个基线都在 30% 左右。报告还把部署和延迟联系起来:推理优化把 RTX 5090 上的单步延迟从 71.2 ms 降到 43.7 ms。

  • Dongyoung Kim, Huiwon Jang, Myungkyu Koo, Suhyeok Jang, Taeyoung Kim, Beomjun Kim, Byungjun Yoon, Changsung Jang, Daewon Choi, Dongsu Han, Donguk Lee, Heeseung Kwon, Hojin Jeon, Jaehyun Kang, Jaekyoung Bae, Jihyuk Lee, Jimin Lee, John Won, Joonwoo Ahn, Junhyeong Park, Junyoung Sung, Kyungmin Lee, Minseong Han, Minsung Yoon, Sejune Joo, Seonil Son, Seungcheol Park, Seunggeun Cho, Seungjun Moon, Seungku Kim, Yonghoon Dong, Yongjin Cho, Youngchan Kim, Chang Hwan Kim, Dohyeon Kim, Heecheol Kim, Heewon Lee, Hensen Ahn, Hyungkyu Ryu, Hyunsoo Choi, Hyunsoo Shin, Jaeheon Jung, Jaewoo Kim, Jinwook Kim, Joochul Chang, Joonsoo Kim, Junghun Park, Jungwoo Park, Junho Cho, Junhyeok Park, Junwon Lee, Kangwook Lee, Kwanghoon Kim, Kyoungwhan Choe, Manoj Bhadu, Nayoung Oh, Sangjun Kim, Sangwoo Kim, Seunghoon Shim, Seunghyun Kim, Seungjun Lee, Seungyup Ka, Sungryol Yang, Wook Jung, Yashu Shukla, Yeonjae Lee, Yeonwoo Bae, Jinwoo Shin

Robot video world models

RoboAlign-R1 让机器人视频预测对任务层面的行为负责,而不只是像素损失。它先微调一个 8B 多模态裁判,再把它蒸馏成一个 98M 奖励模型,并用这个奖励做后训练。这个裁判会给指令遵循、操作成功、动作与结果一致性、时间一致性、接触真实性和物理遵循打分。

论文报告的 RobotWorldBench 分数是 8.52±0.15,而 iVideoGPT 是 7.74±0.62。它的 Sliding Window Re-encoding 方法会在长预测过程中刷新 rollout 上下文,并在只增加约 1% 延迟的情况下,报告了更好的 SSIM、PSNR、LPIPS 和 ROI-LPIPS。这个结论很直接:长时域机器人视频模型既需要行为奖励,也需要 rollout 维护。

Interactive world-model benchmarks

iWorld-Bench 针对交互式世界模型中的一个测量缺口:生成的未来是否遵循动作并保留记忆。它统一了文本指令、one-hot 控制和相机参数的动作输入,让不同控制格式的模型可以在相似任务上比较。

这个基准覆盖面很大。它包含 330,000 个视频片段,选出 2,100 个评测视频,并围绕动作控制难度、记忆和相机跟随定义了 4,900 个测试任务。数据覆盖四种视角、九种户外天气、五种室内光照类型和 18 个仿真环境。给出的文本没有模型排行榜,所以这里能直接确认的贡献是基准规模和动作映射。

Spatial reasoning for unified visual models

JoyAI-Image 围绕空间监督把图像理解、生成和编辑连在一起。系统用 Qwen3-VL-8B-Instruct 做多模态理解和指令解析,再用一个 16B 扩散 Transformer 进行生成和编辑。它的 OpenSpatial 数据引擎从 3D 边界框、掩码、可见性检查和多视角一致性检查中构建空间问答和编辑数据。

报告里最强的结果出现在空间理解上。JoyAI-Image-Und 在九个空间基准上的平均分达到 64.4,比 Qwen3-VL-8B-Instruct 高 5.3 分,并与给定摘要中的 Gemini-2.5-Pro 持平。通用基准分数仍然接近基础模型,这一点很重要,因为新增的空间训练没有在报告测试里抹掉更广泛的视觉能力。

较新可执行检查正在给软件代理设定门槛较早编码代理正在按接口、token 成本和仓库证据接受评判