统一的 VLA 控制与空间动作
视觉-语言-动作(VLA)模型现在被检验的是:它们的内部状态能否同时帮助动作、预测和空间定位。Pelican-Unified 通过共享的潜在状态训练语言推理、未来视频生成和机器人动作块。它在 50 个任务的 RoboTwin 双臂套件上报告了 93.5% 的平均成功率,在 WorldArena 上的 EWM Score 为 66.03。
Evo-Depth 解决的是更具体的部署瓶颈:在不增加深度硬件的情况下提高空间精度。它把从 RGB 提取的深度特征送入一个 0.9B 参数的 VLA 模型。报告的真实世界结果是,在三个任务上平均成功率为 90%,使用 3.2 GB GPU 内存,运行频率为 12.3 Hz。