OPD-V指出,多模态大模型进行视觉推理时,文本信息主导生成会造成模态失衡,使精心构造的特权信息难以发挥作用。论文利用放大图像和遮罩图像构造正、负教师,以模态平衡日志边际定义信任区域,筛选适合自蒸馏的在策略令牌。摘要称,该方法在6个基准、4个模型骨干和5种后训练方法上持续提升推理表现,并降低训练成本。
最近 24 小时暂无可用热度快照。