论文通过合成数据与大规模真实数据的受控实验,研究语言、视觉理解和视觉生成在统一预训练中的知识迁移。研究指出数据复杂度决定模态协同或竞争,共享注意力与归一化、模态专属前馈层更有利于协同;早期联合训练优于后期对齐,并观察到延迟融合造成的“视觉惰性”。作者还提出仅用5%计算预算获得较强生成性能的训练配方,并以13.5B MoE、2T tokens规模验证。
最近 24 小时暂无可用热度快照。