SGLang

general · 首次出现 2026-05-22 · 最近出现 2026-09-01 · 累计提及 135

综述

SGLang 近期进展

SGLang 是一种基于大规模语言模型的自适应分层专家分配技术,旨在提高模型在特定任务上的性能。近期,SGLang 在多个方面取得了显著进展。

SGLang 近期进展

  • MAPLE:MoE模型自适应分层专家分配,75%专家超越原版:该研究提出了一种名为 MAPLE 的新方法,通过自适应分层专家分配,75% 的专家性能超越了原版模型。
  • Qwen3.8-27B 开源:原生多模态,超 Qwen3.7-Plus:Qwen3.8-27B 模型开源,支持原生多模态,性能优于之前的 Qwen3.7-Plus 版本。
  • Qwen3.8-27B开源,SGLang Day-0支持单卡RTX 5090跑206 tok/s:SGLang Day-0版本支持单卡RTX 5090运行,达到206 tok/s的效率。
  • SGLang 首发支持 Muse Glimmer,RTX 5090 上 230 tok/s:SGLang 首次支持 Muse Glimmer,在RTX 5090上达到230 tok/s的性能。
  • 当前焦点与观察点

    SGLang 的最新进展表明,自适应分层专家分配技术正逐渐成为提高大规模语言模型性能的关键。同时,开源模型的性能不断提升,使得更多研究者能够利用这些工具进行创新。此外,对于亚秒级大模型权重加载系统的研究,以及摩尔线程和华为昇腾的适配工作,都为SGLang的发展提供了强有力的支持。

    相关报道

    10 条在档