论文指出,多模态连续潜变量推理存在严重的训练—推理不匹配:训练后验可利用真实答案,导致答案泄漏和先验污染。作者提出AMVL,以正向与反向KL双向校准先验和后验,并在潜变量集成式MLLM中验证,在复杂BLINK基准上平均提升10.83分,单项最高提升32.00分。
最近 24 小时暂无可用热度快照。