预训练 VLA 控制器的运行时不确定性和分布外门控
VLA 系统现在可以在每次动作前做两项检查:给动作 token 计算不确定性分数,并在观测到的状态看起来偏离分布时停止。ReconVLA 在这里有用,因为它包在一个冻结策略外层,不需要团队重新训练基础模型。实际买家是已经在运行预训练 VLA、又要承担光照变化、遮挡或指令含糊带来的静默失败风险的机器人团队。
实现范围窄,也容易验证。先从现有策略里采样多个候选动作,给动作 token 加上校准区间,选不确定性更低的动作,再在执行前运行一个特征空间状态检测器。第一次验证不需要新基准。只要在团队当前任务集上记录干预次数、停机次数和灾难性失败,再回放一小组已知坏条件,比如相机模糊、杂乱场景和异常物体摆放。如果停止信号能抓住坏状态,又不影响正常运行,这就能先作为一层运维组件落地,再谈更大规模的模型改写。