论文提出Nemotron-Labs-Diffusion,将自回归、扩散和自推测解码整合进同一架构,并通过联合AR-扩散目标训练。摘要称,8B模型单次前向生成token数约为Qwen3-8B的6倍,在GB200上借助SGLang实现SPEED-Bench吞吐约4倍提升;模型覆盖3B、8B、14B及视觉语言版本。
最近 24 小时暂无可用热度快照。