Physical Rollout Evaluation for Robot Policies
真实机器人回放指标正在成为 VLA 和世界模型工作的有效筛选器。最直接的做法,是给遥操作灵巧数据加质量评分,在部署前测试 VLA 策略对摄像头腐蚀的鲁棒性,并在桌面任务里把场景保留和接触效用与任务完成度一起评分。
真实机器人回放指标正在成为 VLA 和世界模型工作的有效筛选器。最直接的做法,是给遥操作灵巧数据加质量评分,在部署前测试 VLA 策略对摄像头腐蚀的鲁棒性,并在桌面任务里把场景保留和接触效用与任务完成度一起评分。
本周最强的信号是机器人视觉-语言-动作(VLA)模型的执行质量。HarmoWAM、RAW-Dream 和 Pelican-Unified 的工作将策略增益与想象 rollouts、阶段感知动作控制和共享的推理-动作状态联系起来。
机器人 VLA 团队现在可以在执行轨迹行为层面测试进展:用于家庭场景操作的时间安全监视器、保护接触和释放帧的数据加载器改动,以及任务无关世界模型中的小数据适配。每条路径都给出了具体方法,用来发现最终成功率可能掩盖的失败。
这一窗口中的具身 AI 工作把机器人智能当作执行问题来处理。Pelican-Unified 把推理、未来视频和动作连到同一个潜在状态里。Evo-Depth 加入从 RGB 提取的深度信息,以便更快地做空间控制。LongAct 显示,家庭自主系统在长任务链上仍然会失效。
机器人团队可以针对长时间执行中的失败做小范围改动:为灵巧轨迹加入相对介入,在家务规划测试中把目标进展和整项完成分开评分,以及为以放置为主的 VLA 任务加入 RGB 派生的深度特征。
本周机器人论文最突出的点很明确:具身智能论文正在用更严格的评测和更显式的内部结构收紧动作闭环。LongBench、HazardArena 和 HiVLA 很好地体现了这一重点。这些论文更认可这样一类系统:它们在执行过程中显式暴露规划状态、记忆、风险和与任务相关的信号,然后再用具体动作失败和长时程行为来检验这些设计。
本周的材料指向了机器人系统构建和测试方式上的几项具体变化。评测正在变得更有诊断性:分阶段进度指标和危险前提条件指标,能暴露汇总成功率看不见的失败模式。控制栈也在转向显式规划器状态,让子任务、grounding、记忆和验证以运行数据的形式穿过整个回路。在实验室自动化里,基于进度的子任务切换现在已经有了足够证据,可以把它当作多步流程中的实用运行时组件。
本周 embodied AI 工作最扎实的部分,是那些能在执行时被检查、复用并完成 grounding 的控制系统。VLA 论文继续改进动作闭环,但更清晰的模式已经落在操作层面:显式目标状态、经过验证的 grounding、可执行的合成数据,以及能在部署前暴露失败的鲁棒性测试。世界模型也仍然重要,尤其是在它们把机体布局、未来状态或物体结构编码成策略可直接使用的形式时。
本周的 embodied AI 工作支持三项具体的流程改动:在精密放置中让目标定位在执行前可见,用能暴露脆弱泛化问题的留出式仿真任务为策略发布设闸,以及在把合成机器人轨迹用于训练前先做执行后的视觉检查和过滤。三者都把模型进展绑定到可检查的控制步骤或更严格的评估闭环上,而这正是当前采用压力增长最快的地方。
4 月 11 日的内容不多,但很清楚。最强的工作都在要求模型在输入被污染时仍能工作,以及让视觉预测器在无需额外监督的情况下跨任务复用。STRONG-VLA 给出了机器人方向最清楚的硬指标。ZWM 则用有限的自然视频提出了更广的学习主张。
这组证据里最清楚的操作变化,是把具身控制的评测收紧,把感知预训练做得更窄、更可复用。STRONG-VLA 支持一种部署流程:先用特定的文本和视觉扰动测试 VLA 模型,再用单独的干净数据重新对齐阶段做微调。ZWM 支持一种感知流程:用一个掩码视频预测器去做多个零样本读出,而且已有早期证据表明,哪怕是规模不大的私有视频语料也能派上用场。
4月9日的重点是把结构显式写进具身模型里。最清楚的模式是把形态、未来状态和物体运动学直接写入学习问题本身。WorldMAP 给出了最扎实的硬数值。HEX、QWM、ViVa、BLaDA 和 DailyArt 则把范围扩展到人形机器人、四足机器人、导航、灵巧抓取和可动对象。