VLA failure recovery and long-horizon control
两篇论文直接处理执行漂移。RePO-VLA 用成功、失败和恢复轨迹分别训练,再在部署时使用固定的高 value 条件,不用在线失败检测器。它报告的对抗成功率平均从 20% 提高到 75%,FRBench-Sim 覆盖 46 个任务中的 23,453 个双臂 episode。
CAPS 保持基础 VLA 策略不变,只在不确定性上升时增加推理开销。它用幂分布采样未来动作块,并在熵超过阈值时使用 Metropolis-Hastings 搜索。在 RoboTwin 1.0 上配合 π0,平均成功率为 47.4%,而 π0 为 32.2%,π0 加 TACO 为 41.3%。在 Simpler-WindowX 上,它报告平均成功率 60.5%,领先 π0 和多个 VLA 基线。