机器人策略评估开始看执行机制,不能只看基准分数
机器人学习工作集中在让策略能在真实控制约束下执行。ZR-0、T2VLA 和 Chronos 显示出主要重点:跨具身监督、无需奖励的测试时改进,以及基于完整轨迹的记忆。
机器人学习工作集中在让策略能在真实控制约束下执行。ZR-0、T2VLA 和 Chronos 显示出主要重点:跨具身监督、无需奖励的测试时改进,以及基于完整轨迹的记忆。
机器人策略团队可以围绕评估、部署和几何增加面向执行的检查,从当前工作中获得更多价值。实际做法是:在任务关键运动片段上给模型变体排序,在闭环试验前验证感知-动作回路,并为小误差会导致任务失败的接触阶段存储对象相对姿态。
这一时期的机器人论文集中讨论如何让视觉-语言-动作(VLA)策略在部署后可用。InSight 通过机器人 rollout 增加新的操作原语。Reflective VLA 记录动作后果。G3VLA 将相机校准注入视觉 token。共同重点是在新技能、新相机和不完美数据下获得可测量的行为。
机器人 VLA 团队现在可以围绕现有策略测试三类实用支持层:用于缺失操控技能的 primitive 采集循环、用于在有限真实演示下进行多相机微调的几何路径,以及用于长时程任务调试和数据过滤的步骤级评分。
4月9日的重点是把结构显式写进具身模型里。最清楚的模式是把形态、未来状态和物体运动学直接写入学习问题本身。WorldMAP 给出了最扎实的硬数值。HEX、QWM、ViVa、BLaDA 和 DailyArt 则把范围扩展到人形机器人、四足机器人、导航、灵巧抓取和可动对象。
最清楚的近期方向,是做一个训练流水线,用生成的未来视图离线写导航标签,然后只部署一个小学生模型。第二个具体变化,是把机器人本体结构当作控制模型的显式输入,让相关机器用同一个学到的模型共享能力,并减少预热和重训。第三个可行测试,是在可动对象上加一个感知阶段,从单张图像估计关节,再由操作栈选择接触点和力度。