该研究系统分析固定计算预算下原生视觉语言模型的规模定律,比较模型参数量、token 数量与数据配比的最优分配。结果显示,语言与多模态目标遵循不同扩展规律;语言分配对数据组成较稳定,而多模态分配高度依赖配比。研究还报告跨模态正迁移,改善纯文本空间推理并支持多模态上下文学习。
最近 24 小时暂无可用热度快照。