触觉和力矩适配改造,面向接触密集型 VLA 任务
为现有 VLA 加入触觉和力矩输入,现在看起来是给处理接触密集型操作的团队做的实用升级。最直接的目标是给摄像头视角看不到决定性时刻的任务做改造:脆弱物体的抓取稳定性、擦板时的接触开始,或者插头插入时的对位偏差。MoSS 把物理信号放在独立的流里,再通过共享注意力把它们接到动作模型上,这一点很重要,因为收益不是来自把传感器简单拼接在一起。四个真实机器人任务上,完整配置把 GR00T N1.5 的平均成功率从 20.8% 提升到 49.0%,把 pi_0 从 26.1% 提升到 45.9%,而双信号版本的推理开销只上升到 1.11x。
短期内更现实的做法,是给一两个容易失败的技能加传感器,而不是重写整套策略。已经在跑 GR00T、pi_0,或类似扩散式 VLA 的团队,可以加上指尖触觉和关节力矩记录,在适配器里保持这些流分开,然后在一小组接触驱动任务上测试。简单的检查方法很直接:在同一组任务上比较仅视觉、仅触觉、仅力矩和双信号版本。如果结果和论文一致,组合模型应当在接触时机和力控制最关键的任务上超过每个单信号版本。