机器人策略的执行监督
执行监督已经具体到可以围绕它做产品和工作流。最清楚的近期方向,是给长周期操作做每步重规划的监督器、给机器人后训练做先仿真后纠正的回路,以及给家庭任务基准做安全调整后的评测路径。每个方向都对应底层论文里的报告提升或具体审计结果,而且实现细节已经足够支撑一个聚焦的原型或流程改动。
执行监督已经具体到可以围绕它做产品和工作流。最清楚的近期方向,是给长周期操作做每步重规划的监督器、给机器人后训练做先仿真后纠正的回路,以及给家庭任务基准做安全调整后的评测路径。每个方向都对应底层论文里的报告提升或具体审计结果,而且实现细节已经足够支撑一个聚焦的原型或流程改动。
这一天的论文数量不多,但信号很清楚:机器人论文正在把内部状态和物理约束讲得更明白。Dual-Anchoring 通过在 Video-LLM 内部监督进度和地标记忆,提升了长时程导航。MM-Hand 在硬件上做了同样的事,量化远程腱路由带来的力和延迟代价,同时保持机械手更轻、更模块化,也更容易加传感器。
如果把这一窗口里的机器人工作看成工作流变化,会更有用。一篇论文给出了一套明确做法,把显式进度和地标记忆监督加到 VLN 训练里,并报告了很大的收益且没有额外推理开销。另一篇论文给出了 21-DOF 开源灵巧手在远程腱索布线中的实测力、延迟和维护权衡。两者一起支持一种更广泛的做法变化:在训练和硬件验证时直接跟踪内部状态变量,因为这些测量比最终任务分数更早解释长时程失败。
这一天的机器人论文最强的一点,是研究者把任务结构放进了数据路径和决策路径。最清楚的例子是 \pi_{0.7}、WAV 和 ShapeGen。一条线给 VLA 控制加入更丰富的提示和潜在规划。另一条线构建更窄、几何感知的数据生成和采集系统,让策略一开始就看到正确的变化。
这个时间窗口里的机器人工作给出三项具体的流程变化。移动操作团队可以在现有示范周围加入停靠姿态增强,以恢复导航误差下的性能。类别级操作团队可以通过在类别内变换物体几何来生成新的真实示范,这对把手和接触敏感任务很有用。灵巧手团队可以用贴附式便携遥操作装置降低采集成本,同时提升真实硬件上的操作者成功率和速度。
4月9日的重点是把结构显式写进具身模型里。最清楚的模式是把形态、未来状态和物体运动学直接写入学习问题本身。WorldMAP 给出了最扎实的硬数值。HEX、QWM、ViVa、BLaDA 和 DailyArt 则把范围扩展到人形机器人、四足机器人、导航、灵巧抓取和可动对象。
最清楚的近期方向,是做一个训练流水线,用生成的未来视图离线写导航标签,然后只部署一个小学生模型。第二个具体变化,是把机器人本体结构当作控制模型的显式输入,让相关机器用同一个学到的模型共享能力,并减少预热和重训。第三个可行测试,是在可动对象上加一个感知阶段,从单张图像估计关节,再由操作栈选择接触点和力度。