主题概况

World Models

第 9 / 10 页
趋势
58
想法
59
最近一期
2026-07-22
趋势 · 日 · 2026-04-13 · Embodied AI

机器人论文更看重更干净的基线和更尖锐的语义控制测试

4 月 13 日的机器人论文集在把评估收紧到具体控制问题时最有力。证据最充分的论文都在问:一个简单的 VLA 方案是否已经让很多基准接近饱和,视觉特征是否真的包含动作信息,以及世界模型能否用有语义意义的方式给未来打分。StarVLA-α、LARYBench 和 GWM-MPC 提供了最清楚的证据。

想法 · 日 · 2026-04-13 · Embodied AI

语言引导的操作控制

近期最清晰的变化是更紧的 VLA 基线、直接测试语义控制,以及用于操作数据生成的可供性层。支撑这些判断的证据最强的是:一个简单的 VLM 加 MLP 基线、在留出指令变体上的语言评分规划,以及在物体部位选择决定成败的任务上使用可供性条件抓取生成。

趋势 · 周 · 2026-W15 · Embodied AI

Embodied AI 论文正在提高具备 grounding 且可检查控制系统的标准

本周 embodied AI 工作最扎实的部分,是那些能在执行时被检查、复用并完成 grounding 的控制系统。VLA 论文继续改进动作闭环,但更清晰的模式已经落在操作层面:显式目标状态、经过验证的 grounding、可执行的合成数据,以及能在部署前暴露失败的鲁棒性测试。世界模型也仍然重要,尤其是在它们把机体布局、未来状态或物体结构编码成策略可直接使用的形式时。

想法 · 周 · 2026-W15 · Embodied AI

可检查的机器人控制闭环

本周的 embodied AI 工作支持三项具体的流程改动:在精密放置中让目标定位在执行前可见,用能暴露脆弱泛化问题的留出式仿真任务为策略发布设闸,以及在把合成机器人轨迹用于训练前先做执行后的视觉检查和过滤。三者都把模型进展绑定到可检查的控制步骤或更严格的评估闭环上,而这正是当前采用压力增长最快的地方。

想法 · 日 · 2026-04-11 · Embodied AI

感知与鲁棒性工作流

这组证据里最清楚的操作变化,是把具身控制的评测收紧,把感知预训练做得更窄、更可复用。STRONG-VLA 支持一种部署流程:先用特定的文本和视觉扰动测试 VLA 模型,再用单独的干净数据重新对齐阶段做微调。ZWM 支持一种感知流程:用一个掩码视频预测器去做多个零样本读出,而且已有早期证据表明,哪怕是规模不大的私有视频语料也能派上用场。

想法 · 日 · 2026-04-09 · Embodied AI

Embodied World Models

最清楚的近期方向,是做一个训练流水线,用生成的未来视图离线写导航标签,然后只部署一个小学生模型。第二个具体变化,是把机器人本体结构当作控制模型的显式输入,让相关机器用同一个学到的模型共享能力,并减少预热和重训。第三个可行测试,是在可动对象上加一个感知阶段,从单张图像估计关节,再由操作栈选择接触点和力度。

趋势 · 日 · 2026-04-08 · Embodied AI

具身控制工作集中在有约束的决策机制上

这一天的内容不多,但很清楚。两篇论文都在处理更贴近现实约束的具身决策循环。一篇用事件编码情境上的记忆检索来做 UAV 控制。另一篇用有约束的想象来减少模型式强化学习里的 rollout 漂移。它们共同强调的是,在时间跨度变长或环境更复杂时,动作选择仍然要快、可检查、稳定。

想法 · 日 · 2026-04-08 · Embodied AI

Grounded Control Diagnostics

有两项具体的流程变化很突出。会检索历史案例的具身控制器可以把决策路径暴露出来接受安全复核,因为动作本来就经过事件编码、最近邻检索和机动聚类。世界模型 RL 栈也可以直接开始测量和控制想象漂移,并且在 grounding prior 被蒸馏之后,用一个不会明显增加运行时的方式,把训练转到 grounded latent 上。