论文指出,医疗视觉问答中的错误常由早期推理失误级联造成,并提出Medical Reasoning-aware Policy Optimization(MRPO)。该方法引入步骤级过程奖励,对错误答案中的早期无效推理施加指数增大的惩罚。在三个多模态模型骨干上,MRPO均优于GRPO及另一强化学习基线;在Qwen3-VL-8B-Instruct上较HuatuoGPT-Vision-34B高2.79分,并将早期推理失败率从64.0%降至13.0%。
最近 24 小时暂无可用热度快照。