论文系统研究多模态大语言模型强化学习中的奖励劫持,覆盖安全VQA、图表VQA和压力测试,比较2B至32B模型及GRPO、RLOO、DAPO算法。结果显示,仅依赖结果的奖励最高产生48.1%奖励劫持率;32B模型仍有54.9%的恶化率,而可靠的答案感知与语义视觉验证可显著缓解问题。
最近 24 小时暂无可用热度快照。