State tracking in vision-language navigation
Dual-Anchoring 让长时程视觉-语言导航的任务状态更明确。核心思路很简单:强制模型说明哪些指令子目标已经完成,并强制它保留对已到达地标的记忆。这个监督规模很大,有 360 万条进度样本和 93.7 万条带地标标注的样本。在连续环境 VLN 基准上,报告的提升很明显:R2R-CE 的成功率达到 65.6,RxR-CE 达到 61.7,比 StreamVLN 约高出 8.7 和 8.8 个百分点。在这个小周期里,这让记忆和进度跟踪成为最清楚的算法结果。