Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

观察中研究观察中0 家独立报道0

MADA-RL:面向紧凑模型参数高效推理的多智能体辩论感知强化学习

首次出现 · 2026/7/20 22:38最近活动 · 2026/7/20 22:38

论文提出MADA-RL,将不超过4B参数的紧凑模型分别训练为生成器与批评器,并通过反事实批评器优势函数,让批评器超越生成器集成共识而非简单复述正确答案。仅使用LoRA适配器,在五项数学推理基准上将DeepSeek-R1-Distill-Qwen-1.5B准确率从39.9%提升至41.9%,可训练参数较全量微调基线减少16倍,但仍未超过DeepScaleR和STILL-3。

最近 24 小时事件热度

最近 24 小时暂无可用热度快照。

最近 24 小时暂无可用热度快照。

报道时间线

  1. 聚合入口arXiv 预印本7/20 22:38非独立信源代表报道
    MADA-RL:面向紧凑模型参数高效推理的多智能体辩论感知强化学习