来源笔记
Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation
摘要
JoyAI-Image 是一个统一的图像理解、生成和编辑模型,在基于 Qwen3-VL 的 MLLM 和一个 160 亿参数的扩散 Transformer 之上加入了更强的空间推理能力。
问题
- 现有统一视觉模型往往只是把理解、生成和编辑松散地连在一起,所以图像编辑和生成视角不能稳定利用场景几何。
- 这篇论文关注布局、深度、物体关系、视角变化和跨视角一致性,这些都与可控图像编辑有关,也可能帮助后续的视觉-语言-行动系统和世界模型。
方法
- 该模型使用 Qwen3-VL-8B-Instruct 作为 MLLM,负责图像/文本理解和指令解析。
- 在生成和编辑部分,MLLM 输出隐藏状态特征来条件化一个 160 亿参数的 MMDiT 扩散模型;Wan-2.1 VAE 将图像压缩为潜在 token。
- 作者构建了 OpenSpatial,这是一套以 3D box 为中心的数据引擎,通过 3D 有向框、投影掩码、可见性检查和多视角一致性检查,把扫描数据和网页视频转成空间问答对。
- 训练使用约 1130 万个样本,其中包括 610 万个通用理解样本、340 万个空间理解样本、140 万个指令改写样本和 13.74 万个空间编辑样本。
- MLLM 只在通用数据上用监督学习加 KL 蒸馏进行微调,这样它在学习新空间能力的同时保留通用能力。
结果
- 在 9 个空间基准上,JoyAI-Image-Und 的空间平均分为 64.4,比 Qwen3-VL-8B-Instruct 的 59.1 高 5.3 分,与 Gemini-2.5-Pro 的 64.4 持平。
- 相比基础模型,提升最大的项目是 AllAngles +11.5、3DSR_C +7.7、MMSI +7.7、ERQA +4.9 和 VSI +4.5。
- 在通用基准上,它保持了相近表现:MMBench_CN 83.7 对 83.3,MathVista 74.4 对 75.0,MMStar 71.3 对 70.1,OCRB 87.9 对 90.3。
- OpenSpatial 包含约 300 万条条目,覆盖 5 个空间能力组和 19 个子任务;文中给出的完整空间训练子集规模为 340 万个样本。
- 摘要声称它在生成、长文本渲染和编辑上达到 SOTA 或有竞争力的结果,但所提供文本里没有给出这些部分的详细数值表。