论文将视觉语言模型预训练数据配方拆为两层优化:跨能力类别的比例搜索,以及类别内部的数据集分配。前者采用单变量迭代搜索,后者依据质量与难度评分,通过带约束的凸优化兼顾选择与多样性。作者称该方法优于启发式基线,小规模代理实验得到的比例可迁移至更大规模,并在额外使用80B多模态token后达到与更大预算开源模型竞争的表现。
最近 24 小时暂无可用热度快照。