该报告介绍了在昇腾 NPU SuperPOD 上对万亿参数级 DeepSeek-V4 系列进行全参数后训练的系统优化实践,覆盖并行策略、计算通信编排与内核执行,MFU 达 34.22%,较开源基线提升 2.93 倍。基于 DeepSeek-V4-Flash,团队进一步构建面向运筹优化任务的 CPT/SFT 流程,使用 1 万条、覆盖四类任务和三种表示形式的数据,使模型零样本 Pass@1 达 71.81%。
最近 24 小时暂无可用热度快照。