结构化动作接口支撑具身世界模型
围绕动作相关状态的前一日信号仍在延续,但今天的五篇论文更直接地将结构引入世界建模。视觉轨迹、物理分解和可模拟的回放记录,将动作与预测后果连接起来。证据来自异质的预印本,且评估大多彼此独立,因此它表明了一种共同的设计方向,而不是已经确定的最优架构。
围绕动作相关状态的前一日信号仍在延续,但今天的五篇论文更直接地将结构引入世界建模。视觉轨迹、物理分解和可模拟的回放记录,将动作与预测后果连接起来。证据来自异质的预印本,且评估大多彼此独立,因此它表明了一种共同的设计方向,而不是已经确定的最优架构。
当天的机器人论文将物理细节纳入策略流程。视觉语言动作(VLA)模型加入 3D 结构、可复用示范、缓存动作块和明确的交接检查。RynnWorld-4D、RynnWorld-Teleop 和 Lift3D-VLA 的重点最清晰:让机器人控制更快、更具空间依据,同时减少对原始物理数据采集的依赖。