Cloudflare 介绍 Workers AI 为 Moonshot Kimi K 系列和 Z.ai GLM 等大型长上下文 MoE 模型提供推理服务时采用的三项优化:KV 缓存量化、模型权重压缩,以及针对共享缓存的隔离保护。基于 SGLang 的实验与生产流量表明,这些措施可在不改变模型准确率的前提下提升 GPU 利用率、降低成本并扩大服务规模。
最近 24 小时暂无可用热度快照。