论文提出 Floor First,一套先估算资源下限、再决定是否启用 profiler 的 LLM 服务优化流程。它把每个 decode step 表示为 HBM 字节、FLOPs、网络字节、网络消息和 KV 容量五维资源向量,用 max 与 sum 构成乐观和悲观区间,并以残差判断重叠质量。针对 16 张 NVIDIA H20 上的 DeepSeek-V3.2 风格 671B MoE/MLA 模型,作者比较 TP16 与 EP16+DP-attention,展示布局优劣取决于负载工作点。
最近 24 小时暂无可用热度快照。