具身 AI 论文正在检验机器人模型能否在长时程执行中保持控制
这一窗口中的具身 AI 工作把机器人智能当作执行问题来处理。Pelican-Unified 把推理、未来视频和动作连到同一个潜在状态里。Evo-Depth 加入从 RGB 提取的深度信息,以便更快地做空间控制。LongAct 显示,家庭自主系统在长任务链上仍然会失效。
这一窗口中的具身 AI 工作把机器人智能当作执行问题来处理。Pelican-Unified 把推理、未来视频和动作连到同一个潜在状态里。Evo-Depth 加入从 RGB 提取的深度信息,以便更快地做空间控制。LongAct 显示,家庭自主系统在长任务链上仍然会失效。
机器人团队可以针对长时间执行中的失败做小范围改动:为灵巧轨迹加入相对介入,在家务规划测试中把目标进展和整项完成分开评分,以及为以放置为主的 VLA 任务加入 RGB 派生的深度特征。
这一时期的机器人研究把可靠性当作一个可测量的控制问题来处理。Vision-Language-Action(VLA)策略加入恢复训练、由不确定性触发的搜索,以及面向门店的动作数据。RePO-VLA、CAPS 和 SABER 给出了最强的定量信号。
机器人团队可以用具体产物来测试可靠性工作:用于接触漂移的恢复标注 rollout、用于长时序 VLA 推理的熵门控搜索、把门店视频转成机器人动作流以适配零售场景,以及面向可变形物体的动作条件世界模型。
这一天的机器人论文最强的部分,是更接近真实部署的执行系统。重点很具体:快速在线适应、动作约束的评估、物理安全测试,以及长任务记忆。RL Token、dWorldEval 和 RedVLA 以真实机器人或部署式代理结果作为支撑,而综述论文说明,数据和基准设计仍然限制了这些进展的可比性。
机器人学习工作正在转向支持真实部署的工具和工作流:冻结 VLA 上的快速在线纠正、上线前的场景级物理安全测试,以及能足够贴近真实执行的离线策略排序,从而减少昂贵的机器人运行。这个集合里最强的案例都对准了具体的操作瓶颈:接触密集的末端阶段、有效场景中的风险发现,以及多个策略变体下的评测成本。