Mixture 近期进展
Mixture,即混合模型,是一种在人工智能领域被广泛研究的模型架构。它通过结合多个专家模型来提高性能和泛化能力。
Mixture-of-LoRA架构
Macaron-V1:开源持续学习模型家族,采用Mixture-of-LoRA架构 发布,该模型利用Mixture-of-LoRA架构进行持续学习,旨在提高模型的适应性和效率。
MoE训练内核速度提升
Cursor开源MoK:MoE训练内核速度提升2.37倍 和 Cursor 开源 MoK:NVL72 MoE 训练内核提速 2.37 倍 报道了MoE(Mixture-of-Experts)训练内核的显著速度提升,这有助于加速模型训练过程。
MoE专家并行通信库
Moonshot AI 开源 MoonEP:专为 MoE 训练设计的专家并行通信库 的开源为MoE模型的并行化提供了新的工具,有助于提高训练效率。
MoE-LoRA效率与OOD检测
CARE:自适应专家路由提升MoE-LoRA效率与OOD检测 提出了一种自适应专家路由机制,旨在提高MoE-LoRA模型的效率和对外部数据分布的检测能力。
MoE模型性能
Kimi K3:2.8T参数开源MoE模型,性能接近Claude Fable 5和GPT-5.6 Sol 展示了一个高性能的MoE模型,其参数量达到2.8T,性能接近目前的一些顶尖模型。
MoE模型架构详解
MoE 混合专家模型架构详解:Fable5、GPT 5.6 sol 都在用 对MoE模型架构进行了深入解析,解释了其为何被顶尖模型所采用。
MoE模型发布
开源模型Laguna S 2.1发布:118B MoE,8B激活,1M上下文 的发布展示了MoE模型在参数量和上下文处理方面的最新进展。
当前焦点与观察点
当前,Mixture模型的研究和应用正迅速发展,其性能和效率的提升受到了广泛关注。然而,如何平衡模型复杂度和训练效率,以及如何确保模型的安全性和公平性,仍然是需要解决的问题。