ParVL提出一种多模态大模型并行扩展框架:在共享ViT与LLM主干参数的基础上,以分支专属前缀构建多条视觉和语言计算支路,从而增加计算量而不复制完整主干。作者使用约130亿token进行全参数监督微调,并报告其优于同训练配方的单分支基线;最佳视觉—语言算力分配随任务而变化。
最近 24 小时暂无可用热度快照。