DataComp-VLM(DCVLM)为视觉语言模型训练提供数据策划基准,汇集160个数据集、约6T多模态token,覆盖四类数据和1B至8B模型。实验显示,数据混合比单纯过滤更关键,指令数据占比更高的配方扩展性更好;其基线在200B token下达到63.6%,较FineVision提升5.4个百分点。
最近 24 小时暂无可用热度快照。