闭环操作中的持久状态
当前图像通常缺少完成物理任务所需的信息。POT-VLA在行走、接触、遮挡和恢复过程中保留按角色索引的三维物体记录,在真实世界测试中达到71/80的成功率,而匹配基线为39/80。FM-VLA则将腕部力历史压缩为8个记忆标记;在三个接触密集型任务上,其平均成功率为83.3%,而无记忆策略为27.8%。这些研究共同表明,有用的记忆应保留物理事件和实体,而不只是增加更多过去的图像。
当天最有力的证据强化了最近一次有内容的日度信号:可靠的具身控制依赖于能够在执行过程中持续保留的状态。持久化的三维物体信息、力历史、密集视觉图像块和结构化的未来引导,都能改善操作或规划。结果很有前景,但大多局限于单个机器人和基准;一项鲁棒性研究还表明,加入推理并不能可靠地让策略更安全。
当前图像通常缺少完成物理任务所需的信息。POT-VLA在行走、接触、遮挡和恢复过程中保留按角色索引的三维物体记录,在真实世界测试中达到71/80的成功率,而匹配基线为39/80。FM-VLA则将腕部力历史压缩为8个记忆标记;在三个接触密集型任务上,其平均成功率为83.3%,而无记忆策略为27.8%。这些研究共同表明,有用的记忆应保留物理事件和实体,而不只是增加更多过去的图像。
多篇论文通过显式保留通用表示会丢弃的结构来改善控制。Patch Policy保留密集的Vision Transformer图像块;在使用5155万参数而非76.1亿参数的情况下,其真实机器人结果优于OpenVLA-OFT。SAGE在提出动作前预测可到达的潜在子目标,使PushT在规划时域为150时的成功率从12.7%提升到64.7%。GeoWorldAD同样根据当前和预测的三维几何信息规划驾驶轨迹,在NAVSIM v1上达到91.0 PDMS。共同机制是缩小并面向行动的搜索空间,而不只是扩大规模。
显式的中间计算本身并不能证明控制具有鲁棒性,也不能证明模型具备因果理解。在一项VLA比较中,加入高斯视觉噪声后,潜在迭代推理的成功率降至14.8%,而文本思维链仍保持92.7%;一次自适应攻击还将基于推理的检测器AUC从0.996降至0.493。另一项视频研究发现,生成器即使缺乏较强的显式因果感知,也能生成看似合理的后续内容。这些结果收窄了可作出的结论:必须在推理影响行动或预测结果的环节检验其作用。