混合专家(Mixture of Experts, MoE)是一种神经网络架构,通过门控机制将输入数据路由到不同的专家子网络进行处理,实现参数高效与计算效率的平衡。近期,混合专家模型在学术界和工业界均取得显著进展,成为大模型领域的重要发展方向。
混合专家 近期进展
腾讯微信在8月公布了WeLM模型,其中80B版本已部署于小微场景,617B版本正在开发中,展示了混合专家技术在企业级应用中的潜力。NVIDIA推出的Nemotron 3.5 Lightning是一款30B参数的混合专家模型,已登陆Ollama平台,主打常驻智能体应用,同时在OpenRouter上线,以高吞吐量为特色。DeepGrove发布了Maple-Preview-20B-A1B模型,在iPhone上实现了127 tokens/s的处理速度,证明了混合专家模型在移动设备上的可行性。AMD推出了开源混合专家模型Instella-MoE-16B-A3B,总参数量达16B,但激活参数仅2.8B,显著降低了计算资源需求。
当前焦点与观察点
混合专家模型正朝着更高参数量与更低计算成本的方向发展。研究表明,MESH方法通过内存高效的Sinkhorn优化,显著提升了混合专家训练的效率。同时,针对特定领域的混合专家模型适配研究也在推进,如教Nemotron学习希腊语的研究。随着Cursor等工具发布混合专家模型训练指南,开发门槛正在降低,有望促进这一技术的广泛应用。混合专家模型在SEO/GEO策略构建等垂直领域也展现出应用潜力,未来可能成为企业AI应用的主流架构。