具身模型按韧性和可复用的视觉理解来评判
4 月 11 日的内容不多,但很清楚。最强的工作都在要求模型在输入被污染时仍能工作,以及让视觉预测器在无需额外监督的情况下跨任务复用。STRONG-VLA 给出了机器人方向最清楚的硬指标。ZWM 则用有限的自然视频提出了更广的学习主张。
4 月 11 日的内容不多,但很清楚。最强的工作都在要求模型在输入被污染时仍能工作,以及让视觉预测器在无需额外监督的情况下跨任务复用。STRONG-VLA 给出了机器人方向最清楚的硬指标。ZWM 则用有限的自然视频提出了更广的学习主张。
这组证据里最清楚的操作变化,是把具身控制的评测收紧,把感知预训练做得更窄、更可复用。STRONG-VLA 支持一种部署流程:先用特定的文本和视觉扰动测试 VLA 模型,再用单独的干净数据重新对齐阶段做微调。ZWM 支持一种感知流程:用一个掩码视频预测器去做多个零样本读出,而且已有早期证据表明,哪怕是规模不大的私有视频语料也能派上用场。