论文提出MADA-RL,将不超过4B参数的紧凑模型分别训练为生成器与批评器,并通过反事实批评器优势函数,让批评器超越生成器集成共识而非简单复述正确答案。仅使用LoRA适配器,在五项数学推理基准上将DeepSeek-R1-Distill-Qwen-1.5B准确率从39.9%提升至41.9%,可训练参数较全量微调基线减少16倍,但仍未超过DeepScaleR和STILL-3。
最近 24 小时暂无可用热度快照。