HaiAI123

全球AI工具精選導航

新熱點事件
92
熱度指數
新上榜

ninfer 對比 llama.cpp:Qwen3.8 27B 提速 2.3 倍

2026/10/03 — 10/03 18:49·1 個來源·1 篇報道

事件概覽

2026 年 10 月 3 日,Reddit 的 LocalLLaMA 版塊出現一篇使用者自測帖,內容是有人在 RTX 5090 上對比 ninfer 與 llama.cpp 執行 Qwen3.8 27B 的表現。測試條件為:同一提示詞(與物理、自旋相關,含完整規則)、120k 上下文、開啟 thinking(xhigh)、預設取樣設定,單次執行(oneshot)。據帖子摘要,ninfer 解碼約 147 tokens/s,llama.cpp(Q4_K_M + MTP)約 141 tokens/s,兩者耗時分別為 7 分 40 秒與 8 分 13 秒。帖子作者稱,改用 ninfer 的 NVFP4 版本後輸出量更大。

值得注意的是,報道標題稱 ninfer 相比 llama.cpp 提速 2.3 倍,但摘要中給出的解碼速度差距只有約 4%,兩處說法並不一致。原文片段顯示的表格資料也不完整,只保留了 ninfer 在非 NVFP4 構建下的精度與 MTP 一欄的開頭,無法據此核對全部數字。目前這件事只停留在這一篇使用者發帖,沒有其他來源、後續測試,也沒有 ninfer 或 llama.cpp 任何一方的官方說明。

AI 綜合 1 篇報道生成 · 更新於 2 小時前

最新進展有使用者在 RTX 5090 上對比 ninfer 與 llama.cpp 執行 Qwen3.8 27B:同一提示詞、120k 上下文、開啟 thinking 的單次測試中,ninfer 解碼約 147 tokens/s,llama.cpp(Q4_K_M + MTP)約 141 tokens/s,耗時分別為 7 分 40 秒與 8 分 13 秒。作者稱改用 ninfer 的 NVFP4 版本後輸出量更大。

24 小時熱度峰值 98 · 3 小時前
24 小時前現在

這件事的報道 點標題看原文

今天
  1. 有使用者在 RTX 5090 上對比 ninfer 與 llama.cpp 執行 Qwen3.8 27B:同一提示詞、120k 上下文、開啟 thinking 的單次測試中,ninfer 解碼約 147 tokens/s,llama.cpp(Q4_K_M + MTP)約 141 tokens/s,耗時分別為 7 分 40 秒與 8 分 13 秒。作者稱改用 ninfer 的 NVFP4 版本後輸出量更大。

    想在本机跑大模型的读者可参考这组实测数据。

    Reddit · LocalLLaMAAI 評分 82

同時在說的其他事

熱度怎麼算的?瞭解口徑

熱度按 48 小時內有多少個獨立來源在說這件事算:同一個來源發多條只算一次,並按 24 小時半衰期衰減,所以排前面的是很多人在說的事。

本頁彙總公開訂閱源,標題與摘要由模型整理,版權歸原作者所有;重要資訊請回原文核對。

爆
討論快速增加
新
首報 6 小時內
發酵中
討論仍在增加

回熱點事件榜 →