阅读原文
arXiv 预印本Aniri论文86

OPD-V:通过模态平衡实现视觉在策略自蒸馏

原标题:OPD-V: Visual On-Policy Self-Distillation with Modality Balance

策略内自蒸馏(OPSD)已成为提升多模态大语言模型(MLLM)视觉推理能力的标准后训练方法。现有方法从多样化的输入源中提取特权信息,以指导自蒸馏。然而,这些设计忽视了模态失衡这一MLLM推理固有的挑战。当文本信息主导生成过程时,模型无法充分整合其多模态输入。因此,精心设计的特权信息未能得到充分利用,限制了OPSD的有效性。为研究这一局限性,我们构建了一个使用放大图像的正教师和一个使用掩码图像的负教师,它们表现出不同程度的模态失衡。对二者推理正确性和词元logits的变化进行分析后,我们发现,模态平衡本身可以作为特权信息。受此发现启发,我们提出OPD-V,一种视觉OPSD范式,通过正教师和负教师实现这类信息。正模态平衡logits边际定义了一个模态平衡信赖域,用于筛选自蒸馏所使用的策略内词元。在6个基准、4种MLLM骨干模型和5种后训练方法上的实验表明,OPD-V能够持续提升推理性能,同时降低训练成本。

为什么值得读

视觉推理后训练正从“增加教师信息”转向“控制模态使用方式”,该工作为低成本自蒸馏提供了可检验的新筛选信号。

标签

MLLM视觉推理自蒸馏模态平衡后训练on-policylogits