面向快速权重机器人记忆的语义正则化
训练多阶段装配长上下文策略的团队,应让循环快速权重状态对齐当前指令或子任务,而不应只对普通动作特征施加语义锚定。RoboTTT 表明,快速权重可以压缩 8K 个时间步,并改善装配和受扰恢复;Semantic Anchoring 则发现,动作—指令结构会在微调过程中退化,并且与 OOD 成功率密切相关。这些结果共同表明,更大的记忆同样可能保留任务特定的捷径,而不只是有用的历史信息。
为从快速权重中读取的表示添加对齐损失,并将语义状态与执行细节分到不同通道。成本最低的诊断方法,是在包含无关动作和失败尝试的 1K 与 8K 时间步历史之后,测试动作—指令检索;如果对齐程度随上下文增长而下降,就在重新排序的装配阶段和新的任务组合上比较经过锚定与未锚定的策略。