跨具身形态 VLA 训练
通用机器人策略正在训练成共享高层操作概念,同时仍能生成特定机器人的控制。ZR-0 是最清楚的例子。它在训练中使用密集具身思维链标签,覆盖场景描述、任务进度、未来计划、目标框和离散动作 token。推理时,它跳过文本生成,并通过扩散动作专家输出连续动作块。
可量化的结果很具体。ZR-0 报告在 LIBERO 上的平均成功率为 97.8%;ProcCorpus-60M 覆盖约 6000 万帧、1000 小时和超过 40 万条轨迹。同一天的趋势还把它与无奖励的测试时改进和轨迹记忆归在一起,说明策略规模正在与可执行的动作时序和状态历史绑定。