论文提出 dOPSD,用扩散语言模型自身去噪轨迹中更晚、已解码的步骤,为较早步骤提供教师信息,避免依赖推理时不可得的外部参考答案。在 Dream 和 LLaDA 上,方法据称同时提升域内数学推理与域外代码生成,并优于监督微调及在策略基线。
最近 24 小时暂无可用热度快照。