FlashMLA 是 DeepSeek 开源的 MLA(Multi-head Latent Attention,多头潜在注意力)高效解码内核,用于加速大模型在 Hopper 架构 GPU 上的推理解码阶段。作为 DeepSeek「开源周」的打头项目,它借鉴了 FlashAttention 系列的设计思路,并针对生产环境中变长序列场景做了专门优化。
FlashMLA 近期进展
当前焦点与观察点
FlashMLA 所服务的 MLA 机制是 DeepSeek-V2/V3 系列模型采用的核心注意力结构,将其内核库开源,明显降低了开发者社区自行部署 DeepSeek 模型并进行推理优化的门槛。从 CUDA 高效内核到昇腾平台适配,DeepSeek 正在把训练与推理栈的底层基础设施逐步公开。后续值得关注的观察点包括:非 Hopper 硬件上的社区适配进展、在生产级推理服务中可带来的实际吞吐收益,以及与后续一系列开源项目的协同效果。