Robot Policy Transfer and Execution Reliability
近期最明确的工作集中在迁移接口、跨平台医疗后训练,以及机器人执行的置信度层。证据最强的是这些论文把变化和具体系统及可测增益绑在一起:JoyAI-RA 对跨实体共享动作空间迁移,Open-H-Embodiment 对跨平台手术后训练,Temporal Difference Calibration 对现有 VLA 策略上的失败预测和动作选择。
近期最明确的工作集中在迁移接口、跨平台医疗后训练,以及机器人执行的置信度层。证据最强的是这些论文把变化和具体系统及可测增益绑在一起:JoyAI-RA 对跨实体共享动作空间迁移,Open-H-Embodiment 对跨平台手术后训练,Temporal Difference Calibration 对现有 VLA 策略上的失败预测和动作选择。
这一天最强的结论很明确:机器人论文正在把预训练、预测和真实执行之间的联系收紧。EmbodiedMidtrain 表明,当上游数据更像机器人经验时,VLA 性能会提高。Mask World Model 和 RoboWM-Bench 从两个方向对 world model 提出同样要求:保留与任务相关的结构,然后按可执行行为来判断成功。
最清楚的近期开花点是三件事:VLA 微调前的机器人对齐数据筛选层、面向世界模型的执行式评测流程,以及让骨干和数据混合实验保持可比性的共享训练栈。前两者在语料里有最直接的性能证据。基础设施这一项也有价值,但现有摘录里展示的下游收益还不完整。
这一天最强的一点是:VLA 工作正在把任务结构明确地放进控制循环里。HELM、ST-π 和 ReFineVLA 分别加入了记忆、子任务计划或理由监督,而且都是带有可测效果的明确组件。配套的基准论文 BeTTER 也让这个领域保持克制,它显示高分基准成绩仍然留下了 grounding 和 recomposition 上的大缺口。
最清楚的近期变化,是把长时程 VLA 执行当作一个带记忆、动作检查和恢复机制的监督控制回路,而不只是更大的策略上下文。评测也需要更难的重组和对齐测试,团队在相信基准提升之前应先过这些门槛。基于推理理由的微调看起来适合作为定向训练步骤,但它应该和这些更难的测试一起用,才能看出它提升的是因果任务理解,还是只提升了更容易的基准表面表现。
这个时期规模不大,但方向一致:最强的信号是机器人研究在真实世界长时程评测上变得更具体。LongBench 为操作任务加入了机制层面的基准,而一篇同期的机器人学习历史回顾把这个需求和更大的数据采集、部署周期联系起来。结果是,大家更明确地关注在真实场景里测量执行漂移、时序失败和上下文使用。
真实世界的长时程机器人评估已经具体到会改变日常工作流程。最直接的近期动作是按阶段的内部评测、回放后的结构化失败复盘,以及发布门槛里的动态抓取压力测试。证据里的共同点很明确:更大的机器人数据和部署循环,需要更好的方式去看清执行在时间上的断裂点,而不只是看一次运行有没有成功结束。
这一天的机器人论文最强的一点,是研究者把任务结构放进了数据路径和决策路径。最清楚的例子是 \pi_{0.7}、WAV 和 ShapeGen。一条线给 VLA 控制加入更丰富的提示和潜在规划。另一条线构建更窄、几何感知的数据生成和采集系统,让策略一开始就看到正确的变化。
这个时间窗口里的机器人工作给出三项具体的流程变化。移动操作团队可以在现有示范周围加入停靠姿态增强,以恢复导航误差下的性能。类别级操作团队可以通过在类别内变换物体几何来生成新的真实示范,这对把手和接触敏感任务很有用。灵巧手团队可以用贴附式便携遥操作装置降低采集成本,同时提升真实硬件上的操作者成功率和速度。
4 月 13 日的机器人论文集在把评估收紧到具体控制问题时最有力。证据最充分的论文都在问:一个简单的 VLA 方案是否已经让很多基准接近饱和,视觉特征是否真的包含动作信息,以及世界模型能否用有语义意义的方式给未来打分。StarVLA-α、LARYBench 和 GWM-MPC 提供了最清楚的证据。
近期最清晰的变化是更紧的 VLA 基线、直接测试语义控制,以及用于操作数据生成的可供性层。支撑这些判断的证据最强的是:一个简单的 VLM 加 MLP 基线、在留出指令变体上的语言评分规划,以及在物体部位选择决定成败的任务上使用可供性条件抓取生成。
这一时期最清楚的结果是:机器人放置被写成了一个带显式目标状态的精确对齐问题。AnySlot 先把自然语言指令变成可见的目标标记,再让带目标条件的 Vision-Language-Action 策略负责执行。论文把这个设计和 SlotBench 结合起来,这是一个严格的槽位放置基准,并在零样本设置下报告了接近 90% 的平均成功率。