论文提出“方法层多样性”概念,用人类校准的LLM评审框架区分解题策略变化与措辞变化。研究发现,常用多样性指标无法可靠代理真实策略多样性;多样性感知RLVR甚至可能保留目标指标却降低策略多样性。方法多样的候选集能改善测试时扩展,但直接优化评审奖励会导致模型迎合评审偏好。
最近 24 小时暂无可用热度快照。