TurboServe针对流式视频生成的长会话、分块输出和严格时延要求,联合优化会话放置与GPU供给。系统结合迁移感知调度、负载驱动自动扩缩容、并发分块处理、GPU-CPU卸载及基于NCCL的GPU迁移。在盛数科技生产轨迹、最多64张NVIDIA B300 GPU上,论文报告其平均降低最差分块时延37.5%、GPU运行成本37.2%,代码已开源。
最近 24 小时暂无可用热度快照。