DeepSeek-MoE-16B 近期进展 MAPLE:MoE模型自适应分层专家分配,75%专家超越原版 原文标题:DeepSeek团队提出的MAPLE模型通过自适应分层专家分配,使得75%的专家性能超越了原版MoE模型。 Generic TB-Coverage:MoE语言模型的覆盖感知专家剪枝 原文标题:该研究提出了一种名为Generic TB-Coverage的方法,用于MoE语言模型的覆盖感知专家剪枝,旨在提高模型的效率和准确性。 DODOCO 揭示 MoE 调度瓶颈:路由不均衡是模型固有,系统层无法修正 原文标题:DODOCO研究揭示了MoE模型中路由不均衡的问题,指出这是模型固有的,且系统层无法完全修正。 当前焦点与观察点 DeepSeek-MoE-16B作为大型MoE模型,近期的研究主要集中在提高模型性能和效率上。尽管取得了显著进展,但MoE模型的调度和路由问题仍然是当前研究的焦点和挑战。