论文系统研究70M至500M参数语言模型在PPO对齐中的失稳机制,基于15组模型与语料配置识别出LoRA静默冻结、bfloat16重要性比率溢出和奖励模型误差导致的策略崩溃,并提出适配器合并重初始化、float32更新及三层安全机制。
最近 24 小时暂无可用热度快照。