Prime Intellect 推出 Prime Inference 推理服务平台
Prime Intellect Launches Prime Inference: Serverless and Reserved Serving for Frontier Open Models
Prime Intellect 做了个兼容 OpenAI API 的推理平台,跑开源模型速度到 101 tok/s,还支持按需付费的 Serverless 模式。
Prime Intellect 发布 Prime Inference,一个兼容 OpenAI API 的推理平台,支持 Serverless 和 Reserved 两种服务模式,运行在 NVIDIA Blackwell 硬件上。其 GLM-5.3 部署采用 Dynamo、vLLM 和 NVFP4 KV 压缩技术,每个 prefill 组可承载 66 个会话,单用户生成速度达 101 tok/s。该平台主要面向开源前沿模型的部署场景。
Prime Intellect Launches Prime Inference: Serverless and Reserved Serving for Frontier Open Models
Prime Intellect has launched Prime Inference, an OpenAI-compatible platform for serving frontier open models on NVIDIA Blackwell. Its GLM-5.3 deployment uses Dynamo, vLLM and NVFP4 KV compression to serve 66 sessions per prefill group at 101 tok/s per user. The post Prime Intellect Launches Prime Inference: Serverless and Reserved Serving for Frontier Open Models appeared first on MarkTechPost .