使用腕部相机或移动相机的 Edge-VLA 工程师,应测试在场景坐标中进行缓存,而不是仅依据图像 token 的相似度决定是否复用。VistaVLA 将一个具有语义定位的 3D Gaussian 场景从约 100,000 个基元压缩为 64 个面向策略的 token;消除时间冗余的结果则表明,相邻帧的大多数视觉 token 变化很小。结合这两点,可以维护持久化的 3D token,并仅刷新与观测到的运动相关的基元;光流可以提供稠密运动掩码,其中也包括从无动作标注视频中学习的数据。在静态场景、仅相机运动、仅物体运动以及两者同时发生的条件下进行一个小型析因测试,可以检验在相同延迟预算下,场景坐标缓存是否比图像 token 缓存更能保持任务成功率。由于引用的系统尚未作为组合缓存进行评估,这仍是一个工程假设。
资料来源
Mohan Liu, Zhihao Gu, Xuanyu Chen, Haitian Zhang, Kaimin Mao, Yan Wu, Wei-Yun Yau, Lin Wang
Yuzhou Wu, Yuxin Zheng, Muchun Niu, Yishan Yang, Tianhao Liu, hanwen kang, Jiajian Jing, Linfeng Zhang, Chuan Wen
Yixiang Chen, Peiyan Li, Yuan Xu, Qisen Ma, Jiabing Yang, Kai Wang, Jianhua Yang, Dong An, He Guan, Gaoteng Liu, Jianlou Si, Jun Huang, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang