ELDR 针对预填充-解码分离式大语言模型服务中的 MoE 路由问题,利用预填充阶段的专家激活构建请求签名,通过离线 K-means 分区和在线局部性分带,将请求分配给更可能复用相同专家的解码工作节点。论文在最多 40 张 GPU、3 个 MoE 模型和 2 类负载上测试,称中位 TPOT 较四种负载均衡基线中的最佳者降低 5.9% 至 13.9%,且模型输出不变。
最近 24 小时暂无可用热度快照。