Selective unlearning reaches robot policy level
视觉-语言-动作模型里的安全工作变得更具体了。VLA-Forget 分阶段编辑视觉编码器、跨模态投影器和上层动作层,然后用 retain、forget、mismatch 和 feature-preservation 损失去除不想要的行为,同时不抹掉任务能力。报告的数值对这种干预来说很强:在 OpenVLA-7B 和 Open X-Embodiment 上,它给出 FC 93、RC 91 和 TSR 78;量化后安全违规恢复也低于 NPO,保留能力也明显好于 GA。原因很直接,因为失败目标是机器人的动作,不只是文本输出。