Geometry enters the control loop for robot policies
这一天的机器人工作把几何放进了执行回路。STARRY 和 X-WAM 把未来 RGB-D 预测和动作扩散联系起来,并在操作基准上报告了提升。一篇关于具身 3D 生成的综述说明了这类工作的资产要求,而户外导航研究则在真实街道上测试了语言落地的辅助能力。
这一天的机器人工作把几何放进了执行回路。STARRY 和 X-WAM 把未来 RGB-D 预测和动作扩散联系起来,并在操作基准上报告了提升。一篇关于具身 3D 生成的综述说明了这类工作的资产要求,而户外导航研究则在真实街道上测试了语言落地的辅助能力。
机器人操作工作现在给了团队一个具体办法来测试预测几何是否改善执行:在策略评估中加入 RGB-D 未来预测、末端执行器几何和接触区域检查。相关的 3D 生成工作则给仿真团队指明了一个实用的资产门槛:生成对象在可用于机器人训练前,需要有关节、物理参数、碰撞几何和兼容模拟器的文件。面向户外、语言引导的导航很有前景,但现有证据主要支持一套带完整安全与完成日志的实地测试流程。
4 月 13 日的机器人论文集在把评估收紧到具体控制问题时最有力。证据最充分的论文都在问:一个简单的 VLA 方案是否已经让很多基准接近饱和,视觉特征是否真的包含动作信息,以及世界模型能否用有语义意义的方式给未来打分。StarVLA-α、LARYBench 和 GWM-MPC 提供了最清楚的证据。
近期最清晰的变化是更紧的 VLA 基线、直接测试语义控制,以及用于操作数据生成的可供性层。支撑这些判断的证据最强的是:一个简单的 VLM 加 MLP 基线、在留出指令变体上的语言评分规划,以及在物体部位选择决定成败的任务上使用可供性条件抓取生成。