阅读原文
HuggingFace 每日论文Junlin Han论文91

走向多模态预训练的物理学:知识流、模态协同、早期统一与训练配方

原标题:Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes

论文通过合成数据与大规模真实数据的受控实验,研究语言、视觉理解和视觉生成在统一预训练中的知识迁移。研究指出数据复杂度决定模态协同或竞争,共享注意力与归一化、模态专属前馈层更有利于协同;早期联合训练优于后期对齐,并观察到延迟融合造成的“视觉惰性”。作者还提出仅用5%计算预算获得较强生成性能的训练配方,并以13.5B MoE、2T tokens规模验证。

为什么值得读

多模态模型正从后期拼接转向原生统一训练,这项工作把架构选择、数据复杂度与视觉能力退化联系起来,并给出可复现实验方向。

标签

多模态预训练视觉语言模型MoE知识迁移模态协同早期统一训练配方