论文官方一手精选

小米发布 HySparse2:两级 KV 共享让 MiMo-V3 长上下文预填充计算量降约 5 倍

Xiaomi Details HySparse2 for MiMo-V3: Two-Level KV Sharing Cuts 1M-Token Prefill FLOPs About 5× vs Hybrid SWA

精选理由

小米 LLM-Core 团队搞了个 HySparse2 稀疏注意力,1M token 预填充计算量降约 5 倍,做长上下文的可以看看。

小米 LLM-Core 团队公开了 HySparse2,这是一种面向 MiMo-V3 这类智能体模型设计的混合稀疏注意力方案,核心是两级 KV 共享。在一个 80B-A3B 的 MoE 模型上,处理 1M token 的预填充 FLOPs 相比 Hybrid SWA 降低约 5 倍。该设计针对超长上下文场景下的计算开销问题,属于注意力架构层面的优化。

原文 · pandaily

Xiaomi Details HySparse2 for MiMo-V3: Two-Level KV Sharing Cuts 1M-Token Prefill FLOPs About 5× vs Hybrid SWA

Xiaomi's LLM-Core team published HySparse2, a hybrid sparse-attention design with two-level KV sharing aimed at MiMo-V3-class agentic models, reporting about 5× lower 1M-token prefill FLOPs versus Hybrid SWA on an 80B-A3B MoE.