VLA 论文把执行结构说清楚了,更严格的测试则暴露出推理缺口
这一天最强的一点是:VLA 工作正在把任务结构明确地放进控制循环里。HELM、ST-π 和 ReFineVLA 分别加入了记忆、子任务计划或理由监督,而且都是带有可测效果的明确组件。配套的基准论文 BeTTER 也让这个领域保持克制,它显示高分基准成绩仍然留下了 grounding 和 recomposition 上的大缺口。
这一天最强的一点是:VLA 工作正在把任务结构明确地放进控制循环里。HELM、ST-π 和 ReFineVLA 分别加入了记忆、子任务计划或理由监督,而且都是带有可测效果的明确组件。配套的基准论文 BeTTER 也让这个领域保持克制,它显示高分基准成绩仍然留下了 grounding 和 recomposition 上的大缺口。
最清楚的近期变化,是把长时程 VLA 执行当作一个带记忆、动作检查和恢复机制的监督控制回路,而不只是更大的策略上下文。评测也需要更难的重组和对齐测试,团队在相信基准提升之前应先过这些门槛。基于推理理由的微调看起来适合作为定向训练步骤,但它应该和这些更难的测试一起用,才能看出它提升的是因果任务理解,还是只提升了更容易的基准表面表现。