视觉-语言-动作策略训练
视觉-语言-动作(VLA)论文关注策略学习中决定高层模型能否控制机器人的部分。ZR-0 训练了一个 2.6B 参数的 VLA 模型,使用密集的具身思维链标签;推理时跳过文本生成,由扩散动作专家输出连续动作块。它在 LIBERO 上报告 97.8% 的平均成功率,并使用 ProcCorpus-60M,其中约有 60M 帧,96.8% 的帧带有 ECoT 标签。
T2VLA 在测试时加入强化学习(RL),使用策略自身的置信度作为奖励信号。在 LIBERO 上,它将 OpenVLA-OFT 的平均成功率从 91.0% 提高到 97.2%,将 π0 从 57.7% 提高到 81.9%,将 π0.5 从 77.1% 提高到 85.1%。SA-VLA 处理一个更低层的失败点:固定动作 token 解码。它的状态感知 tokenizer 将 RoboTwin 平均成功率提高到 0.56,而列出的最强 tokenizer 基线为 0.29。