Multi-task VLA control and contact grounding
DyGRO-VLA 将强化学习视为对基础机器人策略的受控编辑。它冻结基础 VLA,只训练路由的残差专家,加入 delta action chunks。在 LIBERO 上,它报告平均成功率 97.1%,比离线基础模型高 4.4 个百分点,在 LIBERO-Long 上高 9.8 个百分点。
AffordVLA 处理的是另一类失效:策略可能选对物体,却碰到错的部位。它在训练时把中间 VLA 视觉 token 与冻结的可供性教师对齐,推理时移除教师。论文报告,在 RoboTwin 上,Easy 比之前最好的基线高 20.5%,Hard 高 12.8%。