事件专题 ·单一信源

vLLM 推出弹性专家并行,可在运行中增减 GPU

vLLM 新增 Elastic Expert Parallelism(弹性专家并行)功能,允许在 MoE 部署运行期间增减 GPU,且对服务中断和停机影响极小。NVIDIA 的 Itay Alroy 将在 PyTorch Conference North America 2026 上介绍 Elastic EP 的架构、关键实现细节和路线图。演讲还将讨论 EP 规模变化时的行为,以及 NIXL EP 如何在实时流量下实现扩缩容。

当前结论

vLLM 的 MoE 服务现在能在线加减 GPU 不停机,NVIDIA 的人在 PyTorch 大会上讲实现细节,做推理部署的别错过。

2 个信源76° AI 热度最后更新 2026/9/26 07:00:00

证据链

2 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。