面向操作型 VLA 策略的接触区域训练与评分
当任务依赖物体部件时,操作团队应该在 VLA 评估中加入接触区域检查,比如把手、盖子、按钮和工具尖端。这里的失效很直接:模型能认出对的物体,却还是碰到了错的部位。
AffordVLA 提供了一条可行的训练路径。它在训练时使用冻结的 affordance 教师,把中间层 VLA 视觉 token 和任务条件化的 affordance 特征对齐,然后在推理时移除教师。这样可以保持部署时的策略路径不变,同时把视觉表征推向有功能的交互区域。一个低成本的初测方法是准备一组保留的部件敏感任务,用掩码或少量人工标注标出预期接触区域,同时按任务成功率和首次接触准确率评分。接触得分应当能捕捉粗粒度成功率看不出的失败。