失败恢复和长时程记忆
可靠性取决于任务开始出错后策略会怎么做。RePO-VLA 使用成功、失败和恢复 rollout 训练,并为它们设置不同标签;论文报告平均对抗成功率从 20% 升至 75%,在规模化真实世界试验中最高达到 80%。关键细节是对不利状态、接触漂移和有用的失败前缀进行监督,而不只使用干净示范。
ECHO 用记忆处理同一个长时程问题。它把成功的子目标片段存入分层记忆,并在推理时检索这些片段。在 LIBERO-Long 上,它报告 93.5% 的成功率,高于原始 π0 基线的 80.7%。这些论文把恢复和记忆变成了 VLA 执行质量中可度量的部分。