阅读原文
cloudflare-blogindustry88

更小、更快、更安全:Cloudflare 如何规模化运行 Kimi 与 GLM

原标题:Smaller, faster, safer: running Kimi and GLM at scale

AI 导读

Cloudflare 介绍 Workers AI 为 Moonshot Kimi K 系列和 Z.ai GLM 等大型长上下文 MoE 模型提供推理服务时采用的三项优化:KV 缓存量化、模型权重压缩,以及针对共享缓存的隔离保护。基于 SGLang 的实验与生产流量表明,这些措施可在不改变模型准确率的前提下提升 GPU 利用率、降低成本并扩大服务规模。

为什么值得读

长上下文 MoE 模型的瓶颈已从模型能力转向显存与多租户调度,这篇文章给出了可落地的优化组合及其生产验证背景。

深度解读

发生了什么

原始事实: Cloudflare 发布文章,介绍 Workers AI 如何在靠近用户的 Cloudflare 数据中心 GPU 上运行 Moonshot 的 Kimi K 系列与 Z.ai 的 GLM。文章聚焦大型、长上下文、混合专家模型的高效部署。

核心技术

原始事实: Cloudflare 将三项技术叠加使用:KV 缓存量化、模型权重压缩,以及在更多请求共享硬件和缓存时增加缓存保护。其推理服务实验与生产流量均使用开源框架 SGLang。

分析: KV 缓存通常会随上下文长度和并发请求增长,因此量化可以直接缓解推理阶段的显存压力;权重压缩则降低模型静态内存占用。共享缓存保护主要对应多租户环境中的隔离、稳定性与潜在数据暴露风险。

关键证据与数字

原始事实: Cloudflare 表示这些优化让 Workers AI 能支持更多客户、降低成本,并且模型准确率没有变化。文章摘要没有给出具体 GPU 型号、量化位宽、吞吐、延迟、显存占用或成本降幅。

未验证推断: “没有变化”可能来自 Cloudflare 的内部评估或生产监控,但仅凭摘要无法判断评测任务、误差范围和统计显著性。

为什么重要

分析: Kimi 与 GLM 代表了对长上下文和 MoE 推理资源要求较高的一类开放模型。若服务商能够同时压缩权重、降低 KV 缓存开销并维持租户隔离,部署重点就从“单模型能否运行”转向“每张 GPU 能稳定承载多少真实请求”。

实际影响

对云服务商而言,这套方案可能减少模型部署所需的 GPU 数量,并改善高并发场景下的资源利用率。对自建推理团队而言,SGLang、KV 缓存量化和权重压缩可以作为优化排查清单,但仍需针对具体模型、上下文长度、并发度和硬件重新基准测试。缓存保护也提示多租户系统不能只关注吞吐,还要验证隔离边界。

局限与不确定性

摘要未说明量化和压缩的具体算法、精度配置、模型版本、硬件配置、负载分布或基线方案,因此无法独立复现其成本与性能结论。生产流量来自 Cloudflare 自身环境,网络拓扑和调度策略可能与普通自建集群不同。文章声称准确率不变,但没有提供评测集与结果表。发布日期为 2026-08-03,需确认其时间信息是否可靠。

原始来源

Cloudflare Blog: Smaller, faster, safer: running Kimi and GLM at scale

标签

CloudflareWorkers AIKimiGLMSGLangKV缓存量化推理服务