跨具身规模和传感器选择
Qwen-RobotManip把机器人形态差异处理为对齐问题。它把不同机械臂、夹爪、相机和动作空间映射到共享的状态-动作模板,然后在约38,100小时的操作数据上训练。大部分规模来自人到机器人的合成流程:该流程把第一视角人类示范渲染成15种双臂机器人配置。报告称其在RoboChallenge Table30-v1通用赛道排名第一,并报告了在AgileX ALOHA、Franka、UR和ARX平台上的真实机器人验证。
MuseVLA加入了另一类泛化压力:策略必须判断什么时候RGB不够用。它根据指令和场景选择热成像、声学、mmWave或不使用额外传感器,把选中的测量转换为有对象定位的传感器图像,再送回VLA。在真实灵巧手任务中,经过合成预训练后,模型在已见传感器引导任务上的平均成功率为80.6%,在未见任务上为66.7%。