真实机器人训练后适配
多篇论文把 VLA 部署视为训练后的问题,并用机器人时间和失败恢复来衡量。EXPO-FT 报告,在平均使用 19.1 分钟在线机器人数据后,八个真实操作任务达到 30/30 成功。BORA 为灵巧手控制加入离线 critic 和一个小型人工引导残差 actor,在五个 Franka 机械臂加 12-DoF 手任务上达到 86.0% 平均成功率。一项持续学习研究给出对照:普通顺序微调会抹掉早期技能,而采用固定动作归一化的经验回放把最终平均分提高到 93.5。
本周机器人研究用真实执行来评估视觉-语言-动作(VLA)策略:在线微调速度、任务保持、接触质量和跨具身覆盖。EXPO-FT、OASIS 和 Qwen-VLA 支撑了证据最足的主张,多数证据来自真实机器人或操作基准。
多篇论文把 VLA 部署视为训练后的问题,并用机器人时间和失败恢复来衡量。EXPO-FT 报告,在平均使用 19.1 分钟在线机器人数据后,八个真实操作任务达到 30/30 成功。BORA 为灵巧手控制加入离线 critic 和一个小型人工引导残差 actor,在五个 Franka 机械臂加 12-DoF 手任务上达到 86.0% 平均成功率。一项持续学习研究给出对照:普通顺序微调会抹掉早期技能,而采用固定动作归一化的经验回放把最终平均分提高到 93.5。
证据较强的控制论文都在动作预测周围加入结构。OASIS 在解码动作块之前预测 SE(3) 中的未来末端执行器位姿,并报告 LIBERO 平均成功率 97.6%,真实世界测试平均成功率 89.2%。Qwen-VLA 使用具身感知提示和共享的动作与轨迹格式,用一个策略覆盖操作、导航和轨迹预测。VLA-Pro 把任务特定 LoRA 适配器存为程序性记忆,并在推理时检索,使保留 UR7e 任务的真实世界成功率从 5.8% 提高到 65.0%。
接触质量开始进入评估目标。Tabero 加入触觉 token 和闭环力命令,然后同时测量成功率、抓握力和施加力。它报告在轻柔指令下平均抓握力降低超过 70%。CoP 将触觉 taxel 读数压缩为接触力和接触位置,用于仿真到真实的灵巧操作,在六种形状上达到 0.78 的真实插孔成功率。Mag-VLA 把同类执行关注点扩展到显微尺度双手机磁操控,接近成功率为 90%,且路径曲率升高时运输成功率下降。
成本是本周证据中的明确约束。ProgVLA 使用一个 0.1B 参数策略,配有压缩多模态 token 和进度头,在 LIBERO 上达到 91.1% 平均成功率,在 LIBERO Long 上达到 88.6%。它的真实 PiPER-arm 测试较低,100 次试验成功率为 68%,这为只看基准的主张提供了有用校验。日级趋势还把 HyperSim 和 SDPG 归入降低真实数据或 GPU 成本的工作,将效率和执行质量放在一起评估。