趋势

机器人论文按训练信号在执行中的保真度来评判模型

日 · 2026-04-21 · Embodied AI

这一天最强的结论很明确:机器人论文正在把预训练、预测和真实执行之间的联系收紧。EmbodiedMidtrain 表明,当上游数据更像机器人经验时,VLA 性能会提高。Mask World Model 和 RoboWM-Bench 从两个方向对 world model 提出同样要求:保留与任务相关的结构,然后按可执行行为来判断成功。

VLA 预训练的数据整理

EmbodiedMidtrain 把数据选择放到 VLA 训练的核心位置。论文先测量通用视觉语言模型数据和机器人轨迹之间的真实不匹配,然后在更接近机器人数据的样本上进行 mid-training。对小型骨干模型,提升很大:InternVL3.5-1B 在 SimplerEnv-Bridge 上的成功率从 36.5 提高到 56.3,在 Libero-10 上从 39.0 提高到 54.2。Qwen3VL-2B 也在 Calvin、SimplerEnv-Bridge 和 Libero-10 上都有提升。这个日子的结论很直接:更好的机器人策略来自更好的动作前数据对齐,而不只是更大的 action head 或更多机器人微调。

以执行为准的 world model

这一时期的 world model 论文更看重可执行结构,而不是逼真的图像预测。Mask World Model 训练未来语义 mask,这样能保留物体布局和接触线索,同时去掉纹理噪声;它在 LIBERO 上报告 98.3% 的平均成功率,在 RLBench 上是 68.3%,领先几种强基线。RoboWM-Bench 从相反角度检验同一问题:生成视频看起来可能合理,但转成动作后还是会失败。它的机器人评测对强生成模型也偏低,逐步分析显示,很多系统能完成接触,却完不成任务序列。合起来看,机器人领域里有用的 world model 要按执行一致性来判断。

跨具身和阶段的共享训练接口

两篇论文把机器人控制周边的训练范围扩展了。UniT 为人类和人形机器人行为引入一套共享的离散动作语言,策略训练和 world-model 训练都建立在同一组 token 上。论文使用了 27,419 条人类轨迹、少样本机器人数据和真人形机器人测试,但摘录没有给出主要差距。VLA Foundry 解决的是另一个瓶颈:它把语言预训练、视觉语言训练和动作训练放进同一套流程,并支持最多 128 张 GPU 的分布式运行和开源模型发布。两者的共同点是为迁移提供基础设施。一条路线尝试跨身体复用人类运动;另一条让完整 VLA 流水线实验更容易复现和比较。

较新代码研究正在围绕生成内容收紧行为检查较早编码论文正在加入真实执行检查,并为长周期工作提供更好的把手