Inference-time medoid selection for stochastic robot action chunks
运行扩散或 flow-matching 机器人策略的团队,可以加一层包装器:对同一观察和指令采样多个动作块,在动作空间里把这些块聚类,然后执行最大簇的 medoid。这是一个可直接部署的改动,因为它不需要重新训练策略,也不需要训练单独的评分器。
KeyStone 是具体模板。它把采样得到的 K 个动作块批量处理,用展开后的动作轨迹做 L2 距离,选择一个实际采样到的动作块,这样就避免了在不同动作模式之间取平均。报告中的提升已经足够支持一次本地 A/B 测试:GR00T N1.6 在 SimplerEnv-WidowX 上、K=4 时,成功率从 50.0% 提升到 63.3%;SmolVLA 在 LIBERO 上、K=16 时,成功率从 50.4% 提升到 57.2%。机器人团队可以先记录单样本失败案例,再用 K 取 {4, 8, 16} 重放同一批任务,只有在额外延迟符合控制回路时才采用这个包装器。