事件专题 ·官方一手

Prime Intellect 推出 Prime Inference 推理服务平台

Prime Intellect 发布 Prime Inference,一个兼容 OpenAI API 的推理平台,支持 Serverless 和 Reserved 两种服务模式,运行在 NVIDIA Blackwell 硬件上。其 GLM-5.3 部署采用 Dynamo、vLLM 和 NVFP4 KV 压缩技术,每个 prefill 组可承载 66 个会话,单用户生成速度达 101 tok/s。该平台主要面向开源前沿模型的部署场景。

当前结论

Prime Intellect 做了个兼容 OpenAI API 的推理平台,跑开源模型速度到 101 tok/s,还支持按需付费的 Serverless 模式。

11 个信源41° AI 热度最后更新 2026/10/3 05:37:18

证据链

11 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。