趋势

可执行接口正成为提升机器人可靠性的共同抓手

日 · 2026-07-22 · Embodied AI

前两个有内容的日期强调了与行动相关的状态和结构化接口。今天的证据在部署、评估和训练中延伸了这一信号:当学习模型的输出被收窄为明确目标、任务相关场景、稳定动力学或可执行轨迹时,表现会更好。结果涵盖实体机器人和仿真环境,但其中几项研究仍局限于特定任务,或缺少受控的硬件对比。

面向真实世界控制的任务聚焦接口

三个系统都在生成行动之前减少歧义。ReferTrack 让视觉-语言-行动(VLA)策略在预测路径点之前,先选择一个带索引的人体检测框;在歧义跟踪任务中,其成功率达到 74.1%,比论文引用的单视角基线高 22.9 个百分点。LENS 在现有规划器和控制器运行之前,移除或合并与任务无关的物体;在报告的设置中,它将高杂乱场景下的控制时间从约 1,000–4,000 秒缩短至约 40–135 秒。DEED 通过同步控制、筛选后的示范、恢复数据和潜空间分布监测,将同样的系统思路应用于人形机器人补货。其硬件研究较为具体,但没有报告组件级增益或对比成功率。

世界模型面临执行层面的测试

世界模型研究越来越多地根据预测是否支持行动来评估模型,而不只是看生成的观测是否合理。KineBench 将生成的视频转换为六自由度末端执行器轨迹,并在仿真中执行这些轨迹;其显式流程在未见轨迹上报告了约 1.5–3 厘米的平移误差,而逆动力学基线的误差接近 10 厘米。Koopman Dreamer 约束潜在动力学以控制长时域滚动误差,使仿真无人机导航成功率从 53.8% 提升至 73.8%。Dream rehearsal 则定位出另一种故障:回放保留了可测量的世界模型知识,但策略却遗忘了技能。在三个随机种子中,克隆高得分的想象轨迹都恢复了该技能;而在相同想象数据上进行强化学习则一次也未恢复。合起来看,这些研究将可执行性、稳定性和组件级诊断确立为检验模型实用性的核心测试。

较新智能体评测触及模糊项目,可靠性机制转移到 harness较早可执行反馈优于仅依赖提示的编码工作流