Prime Intellect 推出 Prime Inference,服务前沿开源模型
2026/10/03 — 10/03 14:12·1 个来源·1 篇报道
事件概览
2026 年 10 月 3 日,Prime Intellect 宣布推出 Prime Inference,这是一个基于 NVIDIA Blackwell 硬件体系打造的推理平台,专门用于服务前沿开源模型,并提供与 OpenAI 兼容的接口。在具体提供形式上,Prime Inference 包含了无服务器与预留两种服务模式。
在技术实现与部署实践方面,该平台在部署 GLM-5.3 时整合了 Dynamo、vLLM 以及 NVFP4 KV 压缩技术。根据官方公布的数据,在该配置下,每组预填充能够同时服务 66 个会话,单用户生成速率达到 101 tok/s。
目前,该平台已正式推出并投入服务。
AI 综合 1 篇报道生成 · 更新于 19 分钟前
最新进展Prime Intellect 推出 Prime Inference,一个在 NVIDIA Blackwell 上服务前沿开源模型的 OpenAI 兼容平台,提供无服务器与预留两种模式。其 GLM-5.3 部署结合 Dynamo、vLLM 和 NVFP4 KV 压缩,每组 prefill 可服务 66 个会话,单用户速率 101 tok/s。

这件事的报道 点标题看原文
Prime Intellect 推出 Prime Inference,一个在 NVIDIA Blackwell 上服务前沿开源模型的 OpenAI 兼容平台,提供无服务器与预留两种模式。其 GLM-5.3 部署结合 Dynamo、vLLM 和 NVFP4 KV 压缩,每组 prefill 可服务 66 个会话,单用户速率 101 tok/s。
想自部署开源模型的团队可参考其吞吐数据
MarkTechPostAI 评分 76
同时在说的其他事
- 523英伟达发布 64GB 版 DGX Spark,售价 4999 美元8 个来源
- 509Apple 收紧 macOS 全盘访问权限,防范 AI Agent 风险7 个来源
- 378Meta 开源 Muse Gadgets 固件与 SDK5 个来源
- 253爆微软发布 MAI-Transcribe-2-Streaming 实时转写模型4 个来源
- 221爆亚马逊拟将约 80 亿美元英伟达芯片转入融资载体3 个来源
- 215Anthropic 投 1 亿美元启动 Claude 工程师学院3 个来源
热度怎么算的?了解口径收起
热度按 48 小时内有多少个独立来源在说这件事算:同一个来源发多条只算一次,并按 24 小时半衰期衰减,所以排前面的是很多人在说的事。
本页汇总公开订阅源,标题与摘要由模型整理,版权归原作者所有;重要信息请回原文核对。
- 爆
- 讨论快速增加
- 新
- 首报 6 小时内
- 发酵中
- 讨论仍在增加
