面向重接触技能的预训练 VLA 物理反馈适配器
给现有 VLA 加一个物理反馈适配器,现在看起来是个很实用的构建方向,适合那些卡在插头插入、易碎物抓取、擦拭或其他重接触步骤上的团队。本周最有力的证据来自 MoSS:这是一个模块化附加组件,把触觉流和力矩流分开,分两个阶段与预训练 VLA 对齐,然后再联合微调。在四个真实机器人任务上,GR00T N1.5 的平均成功率从 20.8% 提升到 49.0%,pi_0 从 26.1% 提升到 45.9%,而推理开销只小幅增加。这个产品形态很明确:它是给一小组容易失败的技能加上的即插即用感知侧车,不是把整套策略栈全部重训。
第一类客户是已经有 vision-language-action 策略、在接近和大幅运动上表现正常,但一到首次接触就掉可靠性的机器人团队。一个低成本的验证办法是,对一两个反复出现的失败模式加监测,然后在同一台机器人上比较三个版本:纯视觉、单一物理模态、以及双流触觉加力矩。MoSS 的消融实验给这个测试提供了明确的设计约束。解耦流、分阶段训练和未来信号目标都很重要,所以快速原型应该保留这些选择,而不是把所有东西压进一个融合编码器里。如果这些增益能在一组小型接触任务上复现,且时延成本低于 1.1x,这就会成为一个很容易为生产操作场景争取通过的支撑层。