VLA papers are targeting attention quality and control latency
关于视觉-语言-动作模型的工作,重点放在执行中的具体瓶颈,而不只是更大的骨干网络。FocusVLA 通过把注意力强制集中到与任务相关的图像区域,并过滤噪声视觉通道,提升了操作表现。在 LIBERO 上,它在多权重设置下用 0.5B 模型取得 98.7% 的平均成功率,略高于几个更大的基线;消融实验也显示,把混合注意力换成级联注意力后,效果明显提升。StreamingVLA 处理的是部署延迟。它的异步流水线把观察、生成和执行重叠起来,在 AFM 下把每步动作时间从 74.5 ms 降到 33.7 ms,同时保持 97.1% 的 LIBERO 平均成功率,并把停顿间隔从 232.3 ms 降到 76.1 ms。AEO 变体把停顿间隔进一步压到 36.0 ms,但成功率降到 94.9%。