机器人策略正在围绕控制环证据重建
机器人学习正被放到控制环中评估。表现最强的论文加入未来变化先验、漂移监测器、critic、世界模型 rollout 和更便宜的运动数据,让视觉-语言-动作(VLA)策略能应对接触、相机变化和有限示范。Bridge-WA、VLA-Corrector 和 TAP 给出了最清楚的实测主张。
机器人学习正被放到控制环中评估。表现最强的论文加入未来变化先验、漂移监测器、critic、世界模型 rollout 和更便宜的运动数据,让视觉-语言-动作(VLA)策略能应对接触、相机变化和有限示范。Bridge-WA、VLA-Corrector 和 TAP 给出了最清楚的实测主张。
机器人团队可以基于现有证据测试三项具体改变:在推理期间中断过期动作块,在静态视角之外采集移动摄像头 episode,并在任务特定示范前用无标签机器人运动预训练 VLA 策略。每项改变都针对操作中的一个可测量失败模式:开环执行期间的漂移、摄像头或物体位置捷径,以及专家遥操作数据不足。
这一时期的机器人学习工作集中在能在真实系统上运行的预测控制。MotuBrain、Being-H0.7 和 LaST-R1 给出的信号最清楚:只要未来状态推理能提高长时程动作质量,又不增加部署延迟,它就有价值。
机器人团队可以用控制测试来检验预测式策略,报告动作质量、p95 推理延迟、更新频率,以及任务数据需求。具体工作包括一个考虑延迟的评测工具、把潜在推理作为策略一部分来更新的 RL 训练后处理,以及一种适用于物理遥操作较慢的接触密集操作任务的 XR 数据采集流程。