主要来源marktechpost
查看原文事件专题 ·官方一手
Prime Intellect 推出 Prime Inference 推理服务平台
Prime Intellect 发布 Prime Inference,一个兼容 OpenAI API 的推理平台,支持 Serverless 和 Reserved 两种服务模式,运行在 NVIDIA Blackwell 硬件上。其 GLM-5.3 部署采用 Dynamo、vLLM 和 NVFP4 KV 压缩技术,每个 prefill 组可承载 66 个会话,单用户生成速度达 101 tok/s。该平台主要面向开源前沿模型的部署场景。
当前结论
Prime Intellect 做了个兼容 OpenAI API 的推理平台,跑开源模型速度到 101 tok/s,还支持按需付费的 Serverless 模式。
11 个信源41° AI 热度最后更新 2026/10/3 05:37:18
证据链
11 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。