Sensor-rate latent buffers for contact-rich VLA control
在接触丰富的操作任务里运行 VLA 策略的机器人团队,应按传感器时序拆分控制环。DAM-VLA 将语言编码一次,稀疏更新视觉,在控制频率上保留密集的力觉和本体感觉历史,并让动作头在每一步读取最新的缓冲潜变量。这对那些同步 VLA 推理会被慢速相机或语言输入拖住、而力峰值又比策略反应更快的实验室来说,是一个直接可改的方案。
一个实际测试可以围绕单个困难接触任务做窄范围 A/B,比如插接或按按钮:把当前同步策略与一个缓冲版本对比,尽量保留现有 VLA 权重,只为快速模态加入门控交叉注意力。DAM-VLA 在 7 个真实 Franka 任务上的平均成功率是 95.2%,而最强同步基线是 40.95%,同时保持 100 Hz 控制。相同摘要还报告,朴素的高频同步 X-VLA_100 下降到 21.9%,所以检查应同时测成功率、动作延迟,以及相机上采样是否削弱行为。