论文研究无人工标注、依靠可验证奖励的零强化学习在万亿参数规模下的训练动态。作者提出包含裁剪重要性采样、训练—推理比例校正和混合精度控制的训练流水线,并报告Ring-2.5-1T-Zero在七项数学基准上的表现及可读性、可复现性和效率优势。
最近 24 小时暂无可用热度快照。