Contact-region evaluation for RGB-D manipulation policies
操作团队应在 VLA 策略测试中增加一个接触区域评估切片。适合的测试用例是那些 3D 误差很小也会改变结果的任务:用把手挂杯子、递交、按压工具、把物体穿过开口放入,以及在障碍物附近移动。评估应记录成功率、碰撞、抓取失败、接触点误差、末端执行器间隙,以及模型是否关注了控制动作的物体区域。
STARRY 提供了一个可以直接参考和测试的设计。它预测未来深度和末端执行器位置,将预测深度反投影到 3D,计算 token 到预测末端执行器的距离,并用这些距离给 action-to-video 注意力加权。论文报告,在 50 个 RoboTwin 2.0 双臂任务上,clean 平均成功率为 93.82%,randomized 平均成功率为 93.30%;在真实 ARX R5 双臂实验中,使用每个任务 50 个示范和每种方法 20 次评估 rollout,平均成功率为 70.8%。它带来的最大价值是失败分析:当策略漏掉把手或在开口附近发生碰撞时,团队可以先检查预测深度、末端执行器轨迹和注意力权重,再继续采集更多示范。