面向冻结 VLA 专家的部署前冒烟测试路由
已经在部署前做冒烟测试的机器人团队,可以把这些 rollout 保留下来,作为每个任务和扰动条件的选择数据。RouterVLA 显示,在 LIBERO-Plus 上,一个简单的 probe 成功率规则用于在冻结专家中选择策略时,held-out 成功率达到 0.6149;全局最佳专家为 0.4686。这个结果有用,因为学习式打分器相对于简单规则提升很小,而复用同一次试验会夸大测得的收益。
一个实用版本会存储每个候选 checkpoint 的 probe 结果、rollout 长度、耗时、终止行为和缺失统计标记,然后用试验不重叠的验证规则为目标条件选择策略。低成本检查是把实验室现有的 commissioning 日志按这条规则重放一遍,并在 held-out rollout 上与单 checkpoint 选择进行比较。