KV-cache

concept · 首次出现 2026-05-22 · 最近出现 2026-09-26 · 累计提及 98

综述

KV-cache(键值缓存)是大型语言模型推理过程中用于存储键值对的关键技术,直接影响模型处理长上下文的效率和资源消耗。近期,多家科技企业和研究机构在KV-cache技术领域取得重要突破,推动了AI推理性能的显著提升。

KV-cache 近期进展

  • 华为发布OceanStor M900,提供PB级共享KV缓存存储,NPU到SSD访问约60微秒,大幅提升了AI系统的数据处理能力。华为发布 OceanStor M900:PB 级共享 KV 缓存存储,NPU 到 SSD 访问约 60 微秒
  • KV-Cache淘汰策略可按风险目标认证,Llama上SnapKV认证通过75%保留率,为高效缓存管理提供了新思路。KV-Cache 淘汰策略可按风险目标认证:Llama 上 SnapKV 认证通过 75% 保留率
  • CompKV是一种补偿感知的稀疏注意力框架,长上下文推理最高提速6.85倍,显著提升了大模型的处理效率。CompKV:补偿感知的稀疏注意力框架,长上下文推理最高提速 6.85 倍
  • SGLang×Qwen×NVIDIA三方合作,用NVFP4 KV Cache突破长上下文与Agentic推理瓶颈,实现了更高效的AI推理。SGLang × Qwen × NVIDIA 三方合作:用 NVFP4 KV Cache 突破长上下文与 Agentic 推理瓶颈
  • 当前焦点与观察点

    KV-cache技术当前正朝着更高效、更智能的方向发展。多家企业和研究机构正在探索不同的优化策略,如华为的PB级共享KV缓存存储、SnapKV的风险目标认证方法以及CompKV的补偿感知稀疏注意力框架等。这些技术的共同目标是降低内存占用、提高推理效率,特别是在处理长上下文和复杂推理任务时。随着AI模型规模的不断扩大,KV-cache技术的创新将成为推动AI应用普及的关键因素之一。

    相关报道

    10 条在档