Voxel heatmap action heads for VLA manipulation policies
训练 OpenVLA-OFT、π0.5 或类似 VLA 策略的团队,应该把动作头当作可替换组件来测试。ActionMap 保持骨干网络不变,把单点动作预测换成用于平移、旋转和夹爪状态的体素热图。训练目标是在动作网格上的软高斯块,推理时用 top-k soft argmax 还原连续指令。
实际测试很简单:在 LIBERO-Spatial 和 LIBERO-Long 上,用原生解码器和体素热图头,在相同训练预算下各跑一遍,然后在一个真实的 Franka 抓取或放置任务上重复一次,并记录抓取位置误差。ActionMap 报告 OpenVLA-OFT 在 LIBERO 四个套件上的平均成功率从 89.1% 提升到 97.3%,在 10% 数据的 LIBERO-Spatial 上从 67.2% 提升到 93.2%,真实 Franka 全量数据试验从 7/30 提升到 20/30。这些数字说明,对出现毫米级末端执行器误差或小数据失败的团队来说,替换解码器是一个值得先做的实验。