3D-aware VLA control
几篇机器人论文把几何信息更直接地放到动作输出附近。GaussianDream 用 3D Gaussian 重建和短时域场景流预测训练一个 VLA 策略,然后在推理时去掉解码头,只保留学到的前缀 token。它在 LIBERO 上的平均成功率是 98.4%,在 RoboCasa Human-50 上是 52.6%。
PointACT 让动作解码器关注多尺度点云特征。它报告的 LIBERO 平均成功率是 96.0%,在同一张表里比 SpatialVLA 高 17.9 个百分点。DISC 处理的是另一类对齐失败:指令生成任务特定策略,控制策略只看观测。这个设计在 LIBERO-90 上达到 94.3%,在一个真实的 9 任务共享上下文设置中达到 86.4%。