Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

观察中研究观察中0 家独立报道0

打破失败级联:面向医疗多模态推理的步骤感知强化学习

首次出现 · 2026/7/3 12:00最近活动 · 2026/7/3 12:00

论文指出,医疗视觉问答中的错误常由早期推理失误级联造成,并提出Medical Reasoning-aware Policy Optimization(MRPO)。该方法引入步骤级过程奖励,对错误答案中的早期无效推理施加指数增大的惩罚。在三个多模态模型骨干上,MRPO均优于GRPO及另一强化学习基线;在Qwen3-VL-8B-Instruct上较HuatuoGPT-Vision-34B高2.79分,并将早期推理失败率从64.0%降至13.0%。

最近 24 小时事件热度

最近 24 小时暂无可用热度快照。

最近 24 小时暂无可用热度快照。

报道时间线

  1. 聚合入口HuggingFace 每日论文7/3 12:00非独立信源代表报道
    打破失败级联:面向医疗多模态推理的步骤感知强化学习