面向长时程机器人执行的运维保障
这个集合里可用的模式,是围绕故障、遗忘和长时程执行建立运维结构。最清楚的近期变化是:给预训练 VLA 控制器加运行时安全层,在机器人微调时加视觉推理训练回归检查,以及为多步骤实验室自动化加入带记忆的子任务进度跟踪。
这个集合里可用的模式,是围绕故障、遗忘和长时程执行建立运维结构。最清楚的近期变化是:给预训练 VLA 控制器加运行时安全层,在机器人微调时加视觉推理训练回归检查,以及为多步骤实验室自动化加入带记忆的子任务进度跟踪。
4 月 13 日的机器人论文集在把评估收紧到具体控制问题时最有力。证据最充分的论文都在问:一个简单的 VLA 方案是否已经让很多基准接近饱和,视觉特征是否真的包含动作信息,以及世界模型能否用有语义意义的方式给未来打分。StarVLA-α、LARYBench 和 GWM-MPC 提供了最清楚的证据。
近期最清晰的变化是更紧的 VLA 基线、直接测试语义控制,以及用于操作数据生成的可供性层。支撑这些判断的证据最强的是:一个简单的 VLM 加 MLP 基线、在留出指令变体上的语言评分规划,以及在物体部位选择决定成败的任务上使用可供性条件抓取生成。
本周 embodied AI 工作最扎实的部分,是那些能在执行时被检查、复用并完成 grounding 的控制系统。VLA 论文继续改进动作闭环,但更清晰的模式已经落在操作层面:显式目标状态、经过验证的 grounding、可执行的合成数据,以及能在部署前暴露失败的鲁棒性测试。世界模型也仍然重要,尤其是在它们把机体布局、未来状态或物体结构编码成策略可直接使用的形式时。
本周的 embodied AI 工作支持三项具体的流程改动:在精密放置中让目标定位在执行前可见,用能暴露脆弱泛化问题的留出式仿真任务为策略发布设闸,以及在把合成机器人轨迹用于训练前先做执行后的视觉检查和过滤。三者都把模型进展绑定到可检查的控制步骤或更严格的评估闭环上,而这正是当前采用压力增长最快的地方。
4 月 11 日的内容不多,但很清楚。最强的工作都在要求模型在输入被污染时仍能工作,以及让视觉预测器在无需额外监督的情况下跨任务复用。STRONG-VLA 给出了机器人方向最清楚的硬指标。ZWM 则用有限的自然视频提出了更广的学习主张。
这组证据里最清楚的操作变化,是把具身控制的评测收紧,把感知预训练做得更窄、更可复用。STRONG-VLA 支持一种部署流程:先用特定的文本和视觉扰动测试 VLA 模型,再用单独的干净数据重新对齐阶段做微调。ZWM 支持一种感知流程:用一个掩码视频预测器去做多个零样本读出,而且已有早期证据表明,哪怕是规模不大的私有视频语料也能派上用场。
4月9日的重点是把结构显式写进具身模型里。最清楚的模式是把形态、未来状态和物体运动学直接写入学习问题本身。WorldMAP 给出了最扎实的硬数值。HEX、QWM、ViVa、BLaDA 和 DailyArt 则把范围扩展到人形机器人、四足机器人、导航、灵巧抓取和可动对象。
最清楚的近期方向,是做一个训练流水线,用生成的未来视图离线写导航标签,然后只部署一个小学生模型。第二个具体变化,是把机器人本体结构当作控制模型的显式输入,让相关机器用同一个学到的模型共享能力,并减少预热和重训。第三个可行测试,是在可动对象上加一个感知阶段,从单张图像估计关节,再由操作栈选择接触点和力度。
这一天的内容不多,但很清楚。两篇论文都在处理更贴近现实约束的具身决策循环。一篇用事件编码情境上的记忆检索来做 UAV 控制。另一篇用有约束的想象来减少模型式强化学习里的 rollout 漂移。它们共同强调的是,在时间跨度变长或环境更复杂时,动作选择仍然要快、可检查、稳定。
有两项具体的流程变化很突出。会检索历史案例的具身控制器可以把决策路径暴露出来接受安全复核,因为动作本来就经过事件编码、最近邻检索和机动聚类。世界模型 RL 栈也可以直接开始测量和控制想象漂移,并且在 grounding prior 被蒸馏之后,用一个不会明显增加运行时的方式,把训练转到 grounded latent 上。
本周的 embodied AI 论文在收紧动作回路时表现最强。最有力的证据来自 DIAL、FocusVLA 和 DriveDreamer-Policy:模型通过改进控制时序、规划支持和运行时检查取得优势。鲁棒性仍是一个现实弱点,因此评估也在同步变得更严格。