论文 arXiv:2607.12829 综述掩码扩散大语言模型的推理加速方法,指出并行生成并不必然带来端到端提速。作者提出统一延迟分解框架,将算法创新、架构与系统优化、推理时扩展分为三条分析轴,并讨论可复现基准与部署挑战。
最近 24 小时暂无可用热度快照。