Instruction-progress and landmark-memory supervision in VLN training
用于视觉-语言导航的训练期状态监督,看起来很快会变成标准消融项和基线,而不是小众附加项。Dual-Anchoring 报告称,当 Video-LLM 代理在训练时被迫写出指令进度并保留地标记忆后,相比 StreamVLN,在 R2R-CE 上的成功率提高 8.7 个百分点,在 RxR-CE 上提高 8.8 个百分点。对机器人团队有用的地方在于这个干预的形式:论文加入了明确的进度和记忆目标,部署时没有额外推理开销。对已经在仿真器或室内机器人上运行 VLN 堆栈的团队来说,这是一条可直接落地的路径。加一个预测已完成与剩余子目标的头,再加一个和经过地标绑定的记忆目标,然后在动策略架构之前先看长时程失败是否变化。
落地的阻碍在标注和评估纪律。论文用 360 万条合成进度样本和 93.7 万条带地标的样本做到这一步,所以大多数实验室会先做一个更小的内部版本。一个便宜的测试很直接:拿现有的 VLN 基准运行,给几千条轨迹标上子目标完成文本和地标回忆目标,然后比较长指令上的失败模式,而不只看总成功率。如果出现同样的模式,进度漂移和记忆漂移就该变成 VLN 训练里的常规跟踪指标,因为它们能在代理开始走偏之前指出错误。