Post-training unlearning workflow for deployed VLA robot policies
微调 VLA 策略的机器人团队需要一条训练后安全修正路径,在不重训整个栈的情况下改行为。VLA-Forget 给出了一种具体做法:把策略编辑流程分别作用于视觉编码器、跨模态投影层和上层动作层,然后在部署前对保留任务和安全探针跑一套固定回归测试。实际使用者是已经在示教数据里发现坏行为,或者在已上线模型里发现隐私敏感模式的团队,他们需要的是一次窄范围修正。
这篇论文的价值在于,它把遗忘问题当成机器人控制问题,而不只是模型合规问题。在 OpenVLA-7B 和 Open X-Embodiment 上,它报告 FC 93、RC 91、TSR 78、SVR 5,同时保留性能比 GA 好得多,量化后恢复能力也优于其他基线。这支持一种以分阶段编辑和量化后验收测试为核心的流程,因为模型在压缩部署时可能把不安全行为恢复出来。
一个低成本验证步骤很直接:从现有策略里挑一个反复出现的禁用动作,或者一个已知的伪视觉触发器,做一次模块级编辑,然后在同一组评测集上并排看三项指标:遗忘成功率、保留任务成功率、量化后的安全违规恢复情况。如果这些数值一起变化,遗忘就会成为机器人部署审查里的实用支撑层。