机器人策略的进步取决于记忆、失败经验复用和可执行的动作控制
本周的机器人学习研究集中于视觉-语言-动作(VLA)策略中的执行瓶颈。任务记忆支持重试和阶段跟踪。失败轨迹与无标注视频提供了更多有用监督。连续轨迹和考虑力的后训练提升了速度与接触安全性。DexVerse显示,这些提升仍有限:在其19项任务评估子集上,测试方法的最高平均成功率只有34%。
本周的机器人学习研究集中于视觉-语言-动作(VLA)策略中的执行瓶颈。任务记忆支持重试和阶段跟踪。失败轨迹与无标注视频提供了更多有用监督。连续轨迹和考虑力的后训练提升了速度与接触安全性。DexVerse显示,这些提升仍有限:在其19项任务评估子集上,测试方法的最高平均成功率只有34%。
机器人团队可以在现有策略外加入任务进度状态和重试控制,从失败轨迹中恢复监督信号,并根据完成时间、接触力和控制器上限测试动作表示。这些改动可以先在小规模任务集上评估,再决定是否投入新的数据采集或更大规模的策略训练。
冻结的机器人策略可以通过规划器控制的重试、事件敏感的任务记忆,以及使用操作员纠正训练的小型适配模块提高可靠性。部署团队还应将灵巧接触任务加入验收测试,因为标准操作套件中的高分很少检验力调节和精细对齐能力。