趋势

更长的机器人记忆与更快的预测成为实用的控制机制

日 · 2026-07-16 · Embodied AI

近期的每日证据将预测性监督与部署效率视为并行问题。当前论文将两者联系得更紧密:只有在控制运行时成本的前提下,更长的历史、预期运动和模拟结果才能改善控制。真实机器人和基准测试中的结果颇具潜力,但大多数结果仍局限于单独的任务套件和内部报告的评估。

长上下文与面向未来的控制

RoboTTT 将最多 8K 个视觉运动时间步压缩为快速权重,使延迟在历史长度增加时保持不变。在三个真实机器人装配任务上,其平均完成率达到 79%,而单步基线为 42%。FoMoVLA 采取互补路径:它将紧凑的未来状态令牌与稀疏点轨迹一同训练,并在推理时移除大部分辅助模块。在 LIBERO 上,其平均成功率达到 98.8%,中位额外延迟为 9.4 ms。这些研究共同表明,时间信息可以通过紧凑的内部状态投入实际控制,而不必依赖不断增长的观测缓冲区。

不阻塞控制的预测

DriftWorld 通过一次前向传播生成动作条件下的未来,速度超过每秒 30 帧;在五个基准测试中,相比扩散基线平均提速 17 倍。Reflex 同样避免了在流匹配视觉-语言-动作(VLA)策略中重复计算。其分区缓存和异步流水线将 LIBERO 上 Pi0.5 的推理时间从 135.2 ms 降至 52.4 ms,并支持稳定的 50 Hz 流式运行。两者共同说明的范围小于一般意义上的实时自主:可以重新组织迭代式生成组件,使规划和执行不再等待完整重算。

鲁棒性测试揭示隐藏的权衡

总体成功率可能掩盖脆弱行为。FLARE 使用优化的物理光照,使三个 LIBERO 测试套件上的基线成功率降至零。它还发现,广泛的颜色增强可能通过教会策略忽略颜色而显得稳健;其保留色度的防御方法在一个真实的颜色相关任务上,将正常光照下的成功率恢复到 97.5%,受攻击条件下的成功率恢复到 92.5%。另一套主动测试框架对位姿、桌面高度和视角等结构化变化进行采样。在 2,331 次真实世界评估中,与随机测试相比,它通常将刻画性能所需的试验次数减少了 20–40%。两篇论文都主张测试失败区域和保留的能力,而不只是平均任务完成率。

预测结果充当训练监督

两项研究利用生成的结果来改进策略,但不将生成器作为部署时的控制器。小米报告称,加入其开放的 380 亿参数 U0 世界模型生成的场景和视频后,π0.5 在陌生操作任务上的成功率从 36.9% 提升至 63.2%。在接触密集型操作中,一个潜在触觉预测器训练中间动作特征以预测未来触觉,随后在推理时移除;真实世界平均成功率达到 74%。两者机制不同,但都将结果建模置于学习流程中。小米的提升来自厂商报告,而触觉结果覆盖五个任务和两个 VLA 骨干网络。

较新验证正聚焦于真正重要的代码路径较早可执行门控揭示静态代理评分遗漏的失败