事件专题 ·多源确认

NVIDIA 用全栈 NIM 优化让 Nemotron 3 Ultra 系统吞吐提升 180%,服务用户数翻倍

NVIDIA 在 4×B200 系统上通过 NIM 微服务对推理栈做全栈协同优化,将 Nemotron 3 Ultra 的系统吞吐从 718 tok/s 提升到 1,997 tok/s;在同等交互体验(每用户 50 token/s)下,同一套硬件能服务约 2.78 倍的并发用户。NVIDIA 公布的 2.5x 是“固定延迟 SLO 下最大化吞吐”的测量,前提条件非常具体:硬件 4× NVIDIA B200,模型 Nemotron 3 Ultra 550B-A55B,负载典型 agentic 场景,软件 NIM 2.0.12。

当前结论

NVIDIA 工程师分享的 Nemotron 3 Ultra 在 4×B200 硬件上通过 NIM 微服务优化,系统吞吐提升 180%,服务用户数翻倍,值得看看具体是怎么做的。

3 个信源78° AI 热度最后更新 2026/9/15 14:29:33

证据链

3 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。