该条目介绍一项名为“Beyond Prediction: Tail-Aware Scheduling for LLM Inference”的研究,主题是将 LLM 推理调度从平均或单点性能预测,转向关注尾部延迟。当前可核实信息仅来自 Hacker News,讨论得分为 2、评论数为 0,尚缺论文作者、实验设置与结果细节。
最近 24 小时暂无可用热度快照。