主要来源shao__meng
查看原文事件专题 ·多源确认
小米 MiMo 团队发布 HySparse2 注意力架构
小米 MiMo 团队宣布 MiMo-V3 将采用新注意力架构 HySparse2。该架构通过 KV Bridging 和 KV Reuse 两级 KV 共享,在 80B-A3B 的 MoE 模型上,1M tokens 时 prefill FLOPs 降至上一代 Hybrid SWA 的 1/5.02,KV cache 从 12.09 GB 降到 2.69 GB。架构上采用 token 级选择取代 64-token 块级选择,RULER-v2 提升 6.6、MRCR-v2 提升 8.1。由于 cross-decoder 的 KV 全部源自前 25 层 self-decoder,prefill 可提前退出,后 24 层整段跳过。论文已发布在 arXiv。
当前结论
小米 MiMo 团队搞了个新注意力架构,1M 上下文时 prefill 计算量和 KV cache 都砍到原来的几分之一,长文检索分数还涨了,做长上下文部署的可以看看论文。
4 个信源79° AI 热度最后更新 2026/9/24 02:44:38
证据链
4 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。