论文摘要称,作者系统研究MoE扩散语言模型的优化、算力分配与架构缩放规律,并据此从零训练30B-A3B的LLaDA MoE v2,使用23.5万亿token。其预训练数据量约为Qwen3的65%,在多项知识、推理和代码基准上接近Qwen3;但来源标注为2026年8月,当前材料尚无法独立核验。
最近 24 小时暂无可用热度快照。