Prime Intellect 推出 Prime Inference,服務前沿開源模型
2026/10/03 — 10/03 14:12·1 個來源·1 篇報道
事件概覽
2026 年 10 月 3 日,Prime Intellect 宣佈推出 Prime Inference,這是一個基於 NVIDIA Blackwell 硬體體系打造的推理平臺,專門用於服務前沿開源模型,並提供與 OpenAI 相容的介面。在具體提供形式上,Prime Inference 包含了無伺服器與預留兩種服務模式。
在技術實現與部署實踐方面,該平臺在部署 GLM-5.3 時整合了 Dynamo、vLLM 以及 NVFP4 KV 壓縮技術。根據官方公佈的資料,在該配置下,每組預填充能夠同時服務 66 個會話,單使用者生成速率達到 101 tok/s。
目前,該平臺已正式推出並投入服務。
AI 綜合 1 篇報道生成 · 更新於 18 分鐘前
最新進展Prime Intellect 推出 Prime Inference,一個在 NVIDIA Blackwell 上服務前沿開源模型的 OpenAI 相容平臺,提供無伺服器與預留兩種模式。其 GLM-5.3 部署結合 Dynamo、vLLM 和 NVFP4 KV 壓縮,每組 prefill 可服務 66 個會話,單使用者速率 101 tok/s。

這件事的報道 點標題看原文
Prime Intellect 推出 Prime Inference,一個在 NVIDIA Blackwell 上服務前沿開源模型的 OpenAI 相容平臺,提供無伺服器與預留兩種模式。其 GLM-5.3 部署結合 Dynamo、vLLM 和 NVFP4 KV 壓縮,每組 prefill 可服務 66 個會話,單使用者速率 101 tok/s。
想自部署开源模型的团队可参考其吞吐数据
MarkTechPostAI 評分 76
同時在說的其他事
- 523輝達釋出 64GB 版 DGX Spark,售價 4999 美元8 個來源
- 509Apple 收緊 macOS 全盤訪問許可權,防範 AI Agent 風險7 個來源
- 378Meta 開源 Muse Gadgets 韌體與 SDK5 個來源
- 253爆微軟釋出 MAI-Transcribe-2-Streaming 即時轉寫模型4 個來源
- 221爆亞馬遜擬將約 80 億美元輝達晶片轉入融資載體3 個來源
- 215Anthropic 投 1 億美元啟動 Claude 工程師學院3 個來源
熱度怎麼算的?瞭解口徑收起
熱度按 48 小時內有多少個獨立來源在說這件事算:同一個來源發多條只算一次,並按 24 小時半衰期衰減,所以排前面的是很多人在說的事。
本頁彙總公開訂閱源,標題與摘要由模型整理,版權歸原作者所有;重要資訊請回原文核對。
- 爆
- 討論快速增加
- 新
- 首報 6 小時內
- 發酵中
- 討論仍在增加
