Generalist VLA policies
Qwen-VLA 是规模化和统一化的核心。它使用 Qwen3.5-4B 做视觉-语言理解,并用 DiT 流匹配动作解码器生成连续动作。模型读取机器人描述、图像和指令,然后在操作、导航和轨迹预测中预测动作块或轨迹块。报告结果覆盖 LIBERO、Simpler-WidowX、RoboTwin、R2R、RxR、ALOHA 分布外试验和 DOMINO 动态操作。
VLA-Pro 走的是模块化迁移路线。它把任务特定的 LoRA 适配器和结构化过程状态一起存储,在推理时检索相关记忆,并为当前动作块融合权重。在报告的设定里,提升幅度很大:π0.5 在 6 个保留的 UR7e 任务上的真实世界成功率从 5.8% 升到 65.0%,RoboTwin 结果在 X-VLA、RDT 和 π0.5 骨干上都有提升。