vLLM 数据:配对 4:8 稀疏让 Kimi-K2.5 推理提速 1.18 倍
搞推理部署的可以看看:B200 上 4:8 稀疏让 MoE 专家层快 1.35-1.65 倍,Kimi-K2.5 实测也有 1.18 倍。
vLLM 项目转发了 @jbish1572 关于配对 4:8 稀疏化的实测数据。在 B200 上,专家层 GEMM 相比稠密 NVFP4 跑出 1.35-1.65 倍的速度提升。在 vLLM 服务场景下,Kimi-K2.5 整体达到 1.18 倍加速。这说明 4:8 稀疏在 MoE 模型推理中有实际收益。
Insightful data on paired 4:8 sparsity from @jbish1572: expert GEMMs ran 1.35-1.65x faster than dense NVFP4 on B200, with Kimi-K2.5 reaching 1.18x in vLLM serving.
https://t.co/ejz7InmVTu