产品多源确认72°

Cognition 实测 NVIDIA Vera Rubin NVL72:推理吞吐达 GB200 的 4.8 倍

精选理由

Cognition 拿 Vera Rubin NVL72 和自己的 GB200 对比,智能体编程场景下推理吞吐直接到 4.8 倍,做推理部署的可以看看数据。

Cognition 在智能体编程这种长上下文、高并发的负载下,对比了 NVIDIA Vera Rubin NVL72 与自家 GB200 NVL72 基线。结果显示 Vera Rubin NVL72 推理总 token 吞吐量最高达 4.8 倍,RL 的输出 token 吞吐量达 3.8 倍。测试聚焦于编码智能体场景的实际推理与强化学习性能。

原文 · CoreWeave

Agentic coding is an unforgiving workload. Long contexts. High concurrency.

@Cognition measured @NVIDIA Vera Rubin NVL72 against their own GB200 NVL72 baseline. Up to 4.8x the total token throughput for inference. 3.8x the output token throughput for RL. https://t.co/l37ZwueuvQ https://t.co/c4iMF8R8dm