NVIDIA 用全栈 NIM 优化让 Nemotron 3 Ultra 系统吞吐提升 180%,服务用户数翻倍
NVIDIA 如何用全栈 NIM 优化让 Nemotron 3 Ultra 多服务 2.5 倍用户 ? 在 4×B200 系统上 @NVIDIAAI 通过 NIM 微服务对推理栈做全栈协同优化,把 ...
NVIDIA 工程师分享的 Nemotron 3 Ultra 在 4×B200 硬件上通过 NIM 微服务优化,系统吞吐提升 180%,服务用户数翻倍,值得看看具体是怎么做的。
NVIDIA 在 4×B200 系统上通过 NIM 微服务对推理栈做全栈协同优化,将 Nemotron 3 Ultra 的系统吞吐从 718 tok/s 提升到 1,997 tok/s;在同等交互体验(每用户 50 token/s)下,同一套硬件能服务约 2.78 倍的并发用户。NVIDIA 公布的 2.5x 是“固定延迟 SLO 下最大化吞吐”的测量,前提条件非常具体:硬件 4× NVIDIA B200,模型 Nemotron 3 Ultra 550B-A55B,负载典型 agentic 场景,软件 NIM 2.0.12。
NVIDIA 如何用全栈 NIM 优化让 Nemotron 3 Ultra 多服务 2.5 倍用户 ? 在 4×B200 系统上 @NVIDIAAI 通过 NIM 微服务对推理栈做全栈协同优化,把 ...
NVIDIA 如何用全栈 NIM 优化让 Nemotron 3 Ultra 多服务 2.5 倍用户 ? 在 4×B200 系统上 @NVIDIAAI 通过 NIM 微服务对推理栈做全栈协同优化,把 Nemotron 3 Ultra 的系统吞吐从 718 tok/s 提升到 1,997 tok/s;在同等交互体验(每用户 50 token/s)下,同一套硬件能服务约 2.78 倍的并发用户。 developer.nvidia.com/blog/how-full-… NVIDIA 公布的 2.5x 不是裸吞吐对比,是“固定延迟 SLO 下最大化吞吐”的测量,前提条件非常具体: · 硬件:4× NVIDIA B200 · 模型:Nemotron 3 Ultra 550B-A55B,550B 总参数、55B 激活的 MoE 模型,且是 MoE + Mamba(SSM)混合架构,原生 256K 上下文 · 负载:典型 agentic 场景,64K token 输入、400 token 输出(长上下文进、短决策出),76% KV 复用率(大量请求共享重复前缀,如系统提示、对话历史) · 交互目标:每用户 50 TPS,即 20ms 的 inter-token latency(ITL),这是流式输出体感的及格线 · 软件:NIM 2.0.12,推荐配置 profile 为 vllm-nvidia-b200-nvfp4-tp4-pp1-throughput-90.0 五层优化 1. 精度 + 自动调优内核:采用 NVFP4 量化(Blackwell 原生的 4-bit 浮点格式),并针对 MoE 和 Mamba 两种异构内核做自动调优。混合架构在通用推理栈里没有现成的高效内核路径,这是 NIM 的主要施展空间之一。 2. 并行策略:TP=4(四卡张量并行)、PP=1,配合专家感知执行提高 MoE 层利用率。 3. 前缀与状态复用:前缀缓存跳过重复上下文的重复计算;部分前缀匹配(partial-prefix matching)从不完全命中中也能回收复用收益;Mamba 状态缓存按架构单独调参,SSM 没有 KV cache,但有自己的状态需要缓存管理。 4. 调度器 / 批处理 / 内存调优:并发序列数、批 token 上限、block 大小、显存分配——目标是在延迟预算内让尽量多的请求同时在飞。 5. MTP 投机解码:多 token 预测,通过 NIM_SPECDEC_ENABLE=1 开启。文章诚实指出其增量收益取决于接受率和剩余显存,不是无条件正收益。 测量方式相当规范 用 NVIDIA AIPerf 重放真实流量(Mooncake 格式 JSONL trace 或捕获的真实请求),并发从 1 扫到 64,画出吞吐-延迟 Pareto 曲线,再按 SLO 选工作点。还明确提醒:发布的曲线只是起点,“不是每个应用都能复现同样的结果”。 NVIDIA 这篇博客读后感 1. 它代表了 agentic 时代的推理优化范式。 Agentic 负载“长进短出、高前缀复用”的特征,让前缀缓存、状态复用、投机解码这些优化的杠杆远大于传统 chatbot 场景。推理容量 = agentic 落地的核心成本瓶颈,这里的每倍提升都直接换算成单位 token 成本下降。 2. “全栈”的真正含义是协同,而非堆叠。 文中最好的工程观点:这些优化是“相互作用的配置束,而不是可以简单把百分比相加的独立开关”。量化改变显存余量,显存影响批大小,批大小影响投机解码的接受率——层与层耦合,所以无法给出单项贡献分解。这是对真实系统优化本质的准确描述。 3. 软硬件协同设计(NVFP4 + Blackwell + 自动调优内核)是 NVIDIA 的护城河叙事。 模型-硬件-服务栈垂直整合带来的提升,是纯软件方案难以复制的。 NVIDIA AI @NVIDIAAI A lot of work goes into serving a model efficiently. For the Nemotron 3 Ultra NIM, our engineers tuned caching, memory, parallelism, decoding and more. On four B200 GPUs, those optimizations supported up to 2.5x more concurrent users while maintaining 50 TPS/user. Read the engineering deep dive → nvda.ws/4xX7SWU 🔗 View Quoted Tweet 💬 1 🔄 0 ❤️ 0 👀 240 📊 1 ⚡