IT之家
DeepSeek V4.1 Flash 上线国家超算互联网,采用不对称编解码架构削减缓存开销
原标题:DeepSeek V4.1 Flash 模型上线国家超算互联网
模型84
DeepSeek V4.1 Flash 接入国家超算互联网,以 552B MoE 规格开放 API 调用。该模型采用因果编解码架构,输入仅激活 8B、输出激活 16B,并将 HBM 占用削减至四分之一。推理与缓存成本的压缩,让超大参数模型在实际调用中落到了更轻巧的账单上。
为什么值得读
展示了超大参数 MoE 通过不对称编解码与缓存压缩削减开销的落地路径,对 Agent 调用的成本控制极具参考价值。
标签
DeepSeekMoEKV-Cache超算互联网大模型推理Agent模型架构