arXiv 论文介绍了原生 Metal 推理运行时 BaseRT,通过 Metal 4 张量 API 和手写矩阵、MoE GEMM 及 FlashAttention 内核,将 M5 Neural Accelerator 用于计算密集型提示处理。在 M5 Pro、15 组模型配置测试中,提示吞吐最高达到 llama.cpp 的 6.4 倍、MLX 的 3.9 倍,解码最高分别领先 1.75 倍和 1.33 倍。
最近 24 小时暂无可用热度快照。