§ 01综述
mixture-of-experts 近期进展
研究提出了一种高效的 MoE 模型超参数迁移方法,旨在加速模型训练过程。
Moonshot AI 开源 MoonEP:专为 MoE 训练设计的专家并行通信库 marktechpost
Moonshot AI 开源了 MoonEP,这是一个专为 MoE 训练设计的专家并行通信库,以优化并行计算。
CARE:自适应专家路由提升MoE-LoRA效率与OOD检测 arXiv cs.LG
CARE 方法通过自适应专家路由提高了 MoE-LoRA 的效率,并增强了开放域检测能力。
Kimi K3:2.8T参数开源MoE模型,性能接近Claude Fable 5和GPT-5.6 Sol arXiv cs.LG
Kimi K3 模型,拥有 2.8T 参数,是首个开源的 MoE 模型,其性能接近 Claude Fable 5 和 GPT-5.6 Sol。
开源模型Laguna S 2.1发布:118B MoE,8B激活,1M上下文 elvis
Laguna S 2.1 模型,拥有 118B 参数,8B 激活,1M 上下文,是当前开源 MoE 模型中的佼佼者。
Thinking Machines Lab 发布 Inkling:975B 参数开源多模态 MoE,激活 41B 参数,可控思考努力 marktechpost
Inkling 模型,拥有 975B 参数,41B 激活,是首个开源的多模态 MoE 模型,支持可控思考努力。
Agents-A1:35B MoE智能体模型在长视野任务上媲美万亿参数性能 arXiv: DeepSeek
Agents-A1 模型,35B 参数,在长视野任务上展现出与万亿参数模型相当的性能。
CAEE 框架通过成本感知优化,提升了多设备 MoE 模型的推理效率。
SARA:通过语义锚定路由对齐解锁MoE多语言知识 arXiv cs.AI
SARA 方法通过语义锚定路由,增强了 MoE 模型在多语言知识处理上的能力。
Prime Intellect 发布 prime-rl 0.6.0,用于训练万亿参数 MoE 模型的智能体 RL marktechpost
Prime Intellect 发布了 prime-rl 0.6.0,这是一款用于训练万亿参数 MoE 模型的智能体强化学习工具。
当前焦点与观察点
MoE 模型的研究和应用正日益增多,特别是在处理多模态数据和长文本方面。
开源 MoE 模型的出现降低了研究门槛,促进了社区发展。
模型性能与参数量之间的关系仍是一个活跃的研究领域。
MoE 模型的部署和推理效率是当前关注的重点。