Training-time pseudo-label generation for single-image vision-language navigation
为单图导航数据集搭建一个只在训练阶段使用教师模型的流水线。WorldMAP 是这组材料里最明确的证据:把生成的未来视图转换成路径监督后再用于部署,比把它们留在运行时循环里更有用。具体流程是一个伪标签生成器,输入一张第一视角图像和一条指令,用世界模型扩展未来视图,把目标区和障碍区投影到俯视代价图里,再给更小的学生模型写入航点标签。做室内导航、又要跑在边缘硬件上的团队会最先关心这一点,因为它让推理保持便宜:测试时只运行学生模型。验证也直接:把伪标签阶段加到现有航点预测器里,在留出场景上把 ADE 和 FDE 跟直接 VLM 预测比较。要超越的结果很具体。在 Target-Bench 上,WorldMAP 报告 ADE 42.06、FDE 38.87,两项都优于 Gemini-3-Pro,也远好于直接用 Qwen3-VL-8B 做轨迹预测。