控制栈正被构建为可复用的基础设施
可复用的控制基础设施仍是核心。整周反复出现的都是让 Vision-Language-Action (VLA) 系统更容易训练、调控和检查的组件。4 月 6 日的 Veo-Act、StarVLA 和 E-VLA 都体现了这一点:用视频模型生成高层计划、用标准化 VLA 代码库开发系统,以及用事件传感处理低照度或模糊场景下的操作。4 月 7 日又沿着这条线推进,重点放在更快的推理和更透明的动作生成上。
本周 embodied AI 工作最扎实的部分,是那些能在执行时被检查、复用并完成 grounding 的控制系统。VLA 论文继续改进动作闭环,但更清晰的模式已经落在操作层面:显式目标状态、经过验证的 grounding、可执行的合成数据,以及能在部署前暴露失败的鲁棒性测试。世界模型也仍然重要,尤其是在它们把机体布局、未来状态或物体结构编码成策略可直接使用的形式时。
可复用的控制基础设施仍是核心。整周反复出现的都是让 Vision-Language-Action (VLA) 系统更容易训练、调控和检查的组件。4 月 6 日的 Veo-Act、StarVLA 和 E-VLA 都体现了这一点:用视频模型生成高层计划、用标准化 VLA 代码库开发系统,以及用事件传感处理低照度或模糊场景下的操作。4 月 7 日又沿着这条线推进,重点放在更快的推理和更透明的动作生成上。
Grounding 已经变成一个具体的控制要求。多篇论文要求系统先确认自己正在对什么对象执行动作,让语言始终和执行过程对应起来,并在部署前暴露失败模式。4 月 10 日的 ProGAL-VLA 和 RoboLab 符合这一标准。到本周末,AnySlot 给出了最清晰的单一例子:它把语言指令转成一个可见的目标标记,再配合 SlotBench,并报告了接近 90% 的平均零样本 slot-level 放置成功率。
机器人论文开始把结构直接写进策略或世界模型里。4 月 8 日的重点是基于检索的决策循环和 grounded imagination,用来保持长时程控制的稳定性。4 月 9 日则把形态信息、未来状态和物体运动学直接纳入学习,覆盖四足机器人、人形机器人、导航、灵巧抓取和关节物体等任务。实际效果是更容易诊断失败原因,也能更好利用任务特定约束。
鲁棒性仍在主要评估环节里。本周包含了对语言条件动作系统更严苛的压力测试,也直接检验了受损输入下的性能。4 月 7 日强调了语言多么容易让机器人策略失效。4 月 11 日的 STRONG-VLA 延续了这一重点,把多模态扰动下的抗干扰能力当作可测量目标,而不是附带检查。和前一周相比,这批论文仍然围绕动作闭环质量展开,但这一周把这个目标和 grounding 检查、可执行数据结合得更紧。