FlashMLA

general · 首次出现 2026-05-22 · 最近出现 2026-09-30 · 累计提及 8

综述

FlashMLA 是 DeepSeek 开源的 MLA(Multi-head Latent Attention,多头潜在注意力)高效解码内核,用于加速大模型在 Hopper 架构 GPU 上的推理解码阶段。作为 DeepSeek「开源周」的打头项目,它借鉴了 FlashAttention 系列的设计思路,并针对生产环境中变长序列场景做了专门优化。

FlashMLA 近期进展

  • 2025 年 2 月 24 日,FlashMLA 在 GitHub 正式开源。官方基准测试显示,其在 H800 GPU 上最高可达到 3000 GB/s 的内存带宽与接近 580 TFLOPS 的算力性能。参考:DeepSeek 开源 FlashMLA,高效 MLA 解码内核
  • 环境要求方面:该内核面向 H800、H100 等 Hopper 架构 GPU,需 CUDA 12.3 及以上、PyTorch 2.0 及以上版本,开箱即用,核心以 CUDA 实现。参考:DeepSeek 开源 FlashMLA,高效 MLA 解码内核
  • 生态拓展方面:DeepSeek 此后持续推进基础设施开源,包含面向昇腾算力平台的组件适配,使开源范围从英伟达 CUDA 内核延伸到国产硬件。参考:DeepSeek开源昇腾算力平台基础设施组件
  • 当前焦点与观察点

    FlashMLA 所服务的 MLA 机制是 DeepSeek-V2/V3 系列模型采用的核心注意力结构,将其内核库开源,明显降低了开发者社区自行部署 DeepSeek 模型并进行推理优化的门槛。从 CUDA 高效内核到昇腾平台适配,DeepSeek 正在把训练与推理栈的底层基础设施逐步公开。后续值得关注的观察点包括:非 Hopper 硬件上的社区适配进展、在生产级推理服务中可带来的实际吞吐收益,以及与后续一系列开源项目的协同效果。

    相关报道

    3 条在档