Mixture

general · 首次出现 2026-05-22 · 最近出现 2026-09-03 · 累计提及 67

综述

Mixture 近期进展

Mixture,即混合模型,是一种在人工智能领域被广泛研究的模型架构。它通过结合多个专家模型来提高性能和泛化能力。

Mixture-of-LoRA架构

Macaron-V1:开源持续学习模型家族,采用Mixture-of-LoRA架构 发布,该模型利用Mixture-of-LoRA架构进行持续学习,旨在提高模型的适应性和效率。

MoE训练内核速度提升

Cursor开源MoK:MoE训练内核速度提升2.37倍Cursor 开源 MoK:NVL72 MoE 训练内核提速 2.37 倍 报道了MoE(Mixture-of-Experts)训练内核的显著速度提升,这有助于加速模型训练过程。

MoE专家并行通信库

Moonshot AI 开源 MoonEP:专为 MoE 训练设计的专家并行通信库 的开源为MoE模型的并行化提供了新的工具,有助于提高训练效率。

MoE-LoRA效率与OOD检测

CARE:自适应专家路由提升MoE-LoRA效率与OOD检测 提出了一种自适应专家路由机制,旨在提高MoE-LoRA模型的效率和对外部数据分布的检测能力。

MoE模型性能

Kimi K3:2.8T参数开源MoE模型,性能接近Claude Fable 5和GPT-5.6 Sol 展示了一个高性能的MoE模型,其参数量达到2.8T,性能接近目前的一些顶尖模型。

MoE模型架构详解

MoE 混合专家模型架构详解:Fable5、GPT 5.6 sol 都在用 对MoE模型架构进行了深入解析,解释了其为何被顶尖模型所采用。

MoE模型发布

开源模型Laguna S 2.1发布:118B MoE,8B激活,1M上下文 的发布展示了MoE模型在参数量和上下文处理方面的最新进展。

当前焦点与观察点

当前,Mixture模型的研究和应用正迅速发展,其性能和效率的提升受到了广泛关注。然而,如何平衡模型复杂度和训练效率,以及如何确保模型的安全性和公平性,仍然是需要解决的问题。

相关报道

10 条在档