跨本体数据与自适应感知
规模声明取决于机器人本体和传感器选择之间的对齐。Qwen-RobotManip 将不同机器人映射到一个共同的状态-动作模板,对缺失维度使用二值掩码,并预测相机坐标系下的末端执行器增量。论文报告的语料约为 38,100 小时,包括覆盖 15 种双手机器人配置的合成人到机器人数据,并在 AgileX ALOHA、Franka、UR 和 ARX 上做了真实机器人验证。
MuseVLA 处理另一类泛化缺口。它根据指令和场景选择热成像、声学、mmWave 或 RGB 感知,再把选中的信号转换成接地的传感器图像。在真实灵巧手任务上,使用合成预训练的版本报告已见任务平均成功率为 80.6%,未见任务为 66.7%。