用于机器人适配的动作分布正则化与增益感知微调
针对 OpenVLA 类策略做微调的机器人团队,可以在投入更多数据采集之前先加一个动作分布正则项。可行的改动很具体:在微调时让概率质量保留在一小块好动作邻域里,然后检查这是否能提升目标环境里的留出任务成功率和 OOD 变体表现。FAN 论文给出了一个明确的检验目标。在 ManiSkill 上用 OpenVLA 做监督微调时,分布内成功率从 78.1 提升到 89.8,平均 OOD 成功率从 58.1 提升到 63.3。这个幅度已经足以支持在仍然依赖单个精确动作标签的任何操作栈里做一次轻量消融。
这也指向一个适合部署团队的配套检查:在微调期间看动作分布是不是过尖。如果策略收缩成很窄的峰值,这在小示范集和轻微执行偏移下就是一个可疑失效模式。一个成本不高的起点,是回放当前微调集,把只用对数似然的训练和在偏好动作周围加入局部高斯先验的同一套训练做对比,并跟踪小幅视觉、语义和执行偏移下的成功率。控制器增益论文强化了这个工作流,因为它说明可学习性取决于控制接口,也取决于策略目标。在行为克隆里,最佳闭环成功率出现在较平滑、过阻尼的增益设置中,而 torque-to-position retargeting 在最高 25x decimation 下仍能保持至少 90% 的成功率,joint-position MSE 低于 1e-3。把预训练 VLA 迁移到新机械臂或新控制器时,团队可以把动作容差调节和增益选择看成一个微调问题,而不是两步分开的清理工作。