ninfer 對比 llama.cpp:Qwen3.8 27B 提速 2.3 倍
2026/10/03 — 10/03 18:49·1 個來源·1 篇報道
事件概覽
2026 年 10 月 3 日,Reddit 的 LocalLLaMA 版塊出現一篇使用者自測帖,內容是有人在 RTX 5090 上對比 ninfer 與 llama.cpp 執行 Qwen3.8 27B 的表現。測試條件為:同一提示詞(與物理、自旋相關,含完整規則)、120k 上下文、開啟 thinking(xhigh)、預設取樣設定,單次執行(oneshot)。據帖子摘要,ninfer 解碼約 147 tokens/s,llama.cpp(Q4_K_M + MTP)約 141 tokens/s,兩者耗時分別為 7 分 40 秒與 8 分 13 秒。帖子作者稱,改用 ninfer 的 NVFP4 版本後輸出量更大。
值得注意的是,報道標題稱 ninfer 相比 llama.cpp 提速 2.3 倍,但摘要中給出的解碼速度差距只有約 4%,兩處說法並不一致。原文片段顯示的表格資料也不完整,只保留了 ninfer 在非 NVFP4 構建下的精度與 MTP 一欄的開頭,無法據此核對全部數字。目前這件事只停留在這一篇使用者發帖,沒有其他來源、後續測試,也沒有 ninfer 或 llama.cpp 任何一方的官方說明。
AI 綜合 1 篇報道生成 · 更新於 2 小時前
最新進展有使用者在 RTX 5090 上對比 ninfer 與 llama.cpp 執行 Qwen3.8 27B:同一提示詞、120k 上下文、開啟 thinking 的單次測試中,ninfer 解碼約 147 tokens/s,llama.cpp(Q4_K_M + MTP)約 141 tokens/s,耗時分別為 7 分 40 秒與 8 分 13 秒。作者稱改用 ninfer 的 NVFP4 版本後輸出量更大。
- 熱度指數
- 92
- 獨立來源
- 1
- 報道數
- 1
- 首報
- 4 小時前
這件事的報道 點標題看原文
有使用者在 RTX 5090 上對比 ninfer 與 llama.cpp 執行 Qwen3.8 27B:同一提示詞、120k 上下文、開啟 thinking 的單次測試中,ninfer 解碼約 147 tokens/s,llama.cpp(Q4_K_M + MTP)約 141 tokens/s,耗時分別為 7 分 40 秒與 8 分 13 秒。作者稱改用 ninfer 的 NVFP4 版本後輸出量更大。
想在本机跑大模型的读者可参考这组实测数据。
Reddit · LocalLLaMAAI 評分 82
同時在說的其他事
- 529發酵中Apple 收緊 macOS 全盤訪問許可權,防範 AI Agent 風險8 個來源
- 453輝達釋出 64GB 版 DGX Spark,售價 4999 美元8 個來源
- 334爆Opus 5.5 與 GPT-6 Sol 同日釋出,每任務成本誰更低4 個來源
- 327Meta 開源 Muse Gadgets 韌體與 SDK5 個來源
- 219微軟釋出 MAI-Transcribe-2-Streaming 即時轉寫模型4 個來源
- 192亞馬遜擬將約 80 億美元輝達晶片轉入融資載體3 個來源
熱度怎麼算的?瞭解口徑收起
熱度按 48 小時內有多少個獨立來源在說這件事算:同一個來源發多條只算一次,並按 24 小時半衰期衰減,所以排前面的是很多人在說的事。
本頁彙總公開訂閱源,標題與摘要由模型整理,版權歸原作者所有;重要資訊請回原文核對。
- 爆
- 討論快速增加
- 新
- 首報 6 小時內
- 發酵中
- 討論仍在增加
