用于低数据操作微调的体素热图动作头
微小的末端执行器误差仍会决定许多操作 rollout 的成败。ActionMap 给 VLA 团队提供了一个可测试的改造方案:把原生连续动作解码器换成覆盖平移、旋转和夹爪命令的体素热图头,再用 top-k soft argmax 解码连续动作。
这个改造范围很小,可以放进现有 OpenVLA-OFT 或 pi0.5 训练运行中做消融。保持 backbone 和数据集不变,用动作网格上的高斯 blob 训练热图头,并把抓取位置误差和任务成功率同当前的 L1 头或 flow-matching 头比较。ActionMap 的结果支持这项检查:在 LIBERO 上配合 OpenVLA-OFT、训练步数相同的情况下,平均成功率从 89.1% 升到 97.3%。只用 43 条 LIBERO-Spatial 演示时,它达到 93.2%,L1 头为 67.2%。在真实 Franka 任务中,它完成 30 次试验中的 20 次,回归头为 30 次中的 7 次。
这个方案最适合受限于演示稀缺,或在抓取、扫动和插入中遇到毫米级偏差的团队。低成本验证方式是在当前策略上按任务替换动作头,不改 backbone,并在真实机器人上同时报告成功率和末端执行器误差。