论文提出等谱优化(ISO),将强化学习可验证奖励(RLVR)后的模型更新拆解为固定奇异值谱、优化输入与输出奇异向量框架。离线的 ISO-Merger 可无数据合并共享基座的专长模型,在线的 ISO-Optimizer 则在冻结谱的条件下使用 AdamW 或 Muon 优化框架;在 1.5B 至 8B 模型的推理和代码任务上,报告称其能以更少训练步数达到或超过基线表现。
最近 24 小时暂无可用热度快照。