持续世界模型演练中的可执行轨迹过滤
训练机器人控制器的持续模型基础强化学习团队,应先按执行可行性过滤想象出的演练轨迹,再将其克隆到策略网络中。Dream rehearsal 通过克隆高评分的想象轨迹恢复了被遗忘的行为,而在相同想象数据上进行强化学习却未能恢复;不过,该结果来自 MiniGrid,在那里物理可行性并不是限制因素。KineBench 展示了如何将生成的动作转换为 6D 末端执行器轨迹并在仿真中执行,Koopman Dreamer 则表明,长时域潜变量稳定性会影响闭环控制。
因此,对于连续控制机器人,评分步骤应结合预测回报、仿真器执行结果、运动学可行性和轨迹一致性检查。一项低成本评估是固定想象数据,在已经学会的任务上比较仅按回报选取前四分之一进行克隆与经过可行性过滤后进行克隆的效果,同时测量保留的任务成功率和仿真器拒绝率,而无需收集新的机器人数据。这样可以检验 dream rehearsal 能否迁移到离散环境之外,以及那些表面上有价值的想象轨迹是否因正确的物理原因被拒绝。