Embodied World Models
最清楚的近期方向,是做一个训练流水线,用生成的未来视图离线写导航标签,然后只部署一个小学生模型。第二个具体变化,是把机器人本体结构当作控制模型的显式输入,让相关机器用同一个学到的模型共享能力,并减少预热和重训。第三个可行测试,是在可动对象上加一个感知阶段,从单张图像估计关节,再由操作栈选择接触点和力度。
最清楚的近期方向,是做一个训练流水线,用生成的未来视图离线写导航标签,然后只部署一个小学生模型。第二个具体变化,是把机器人本体结构当作控制模型的显式输入,让相关机器用同一个学到的模型共享能力,并减少预热和重训。第三个可行测试,是在可动对象上加一个感知阶段,从单张图像估计关节,再由操作栈选择接触点和力度。
这一天的内容不多,但很清楚。两篇论文都在处理更贴近现实约束的具身决策循环。一篇用事件编码情境上的记忆检索来做 UAV 控制。另一篇用有约束的想象来减少模型式强化学习里的 rollout 漂移。它们共同强调的是,在时间跨度变长或环境更复杂时,动作选择仍然要快、可检查、稳定。
有两项具体的流程变化很突出。会检索历史案例的具身控制器可以把决策路径暴露出来接受安全复核,因为动作本来就经过事件编码、最近邻检索和机动聚类。世界模型 RL 栈也可以直接开始测量和控制想象漂移,并且在 grounding prior 被蒸馏之后,用一个不会明显增加运行时的方式,把训练转到 grounded latent 上。
本周的 embodied AI 论文在收紧动作回路时表现最强。最有力的证据来自 DIAL、FocusVLA 和 DriveDreamer-Policy:模型通过改进控制时序、规划支持和运行时检查取得优势。鲁棒性仍是一个现实弱点,因此评估也在同步变得更严格。
本周的 embodied AI 工作指向构建和评估上的三个具体变化。一个是能减少真实机器人 VLA 停顿的运行时执行层。另一个是在演示预算很紧时提升操作训练效果的潜在未来状态接口。第三个是面向指令跟随的释义压力测试,因为当前 VLA 策略在措辞变化时仍会损失大量任务成功率。
4 月 5 日是一个以动作控制为中心的强 embodied-AI 日。最清楚的论文改进了感知和执行之间发生的事情:更安全的 VLA 策略、自适应 action chunking,以及用于驾驶的联合视频-动作规划。共同点是操作层面的细节。作者在模块级编辑机器人策略,在推理时调整重规划,并训练世界模型,让预测场景和计划动作保持一致。
这里的具身 AI 工作在控制接口上变得更具体了。最清楚的近期开端是:给已部署的 VLA 策略做训练后遗忘流程,给机器人重规划加一层推理时自适应分块,以及为驾驶世界模型建立联合视频-轨迹评测线。每一项都对准了一个明确的操作痛点:在不丢掉任务能力的前提下移除不安全行为,减少操控里的固定块长调参,以及提升驾驶规划器的零样本迁移。