Qwen3.8-Flash-Next 177B 單張 RTX 5070 跑出 11-15 tok/s
2026/10/03 — 10/03 15:12·1 個來源·1 篇報道
事件概覽
2026 年 10 月 3 日,Reddit 的 LocalLLaMA 版塊出現一篇關於本地推理的帖子。發帖人表示,自己一直在 Windows 上除錯一套基於 llama.cpp 的專家流式方案,用來執行 Qwen3.8-Flash-Next 177B,量化格式為 UD-IQ3_XXS。硬體是單張 RTX 5070,視訊記憶體 12GB,搭配 32GB DDR4-2400 記憶體、Ryzen 5 5600GT 處理器和 PCIe Gen3 介面。按帖子標題的說法,這套配置的速度區間是 11-15 tok/s。
帖子給出了幾組具體數字:基準測試約為 11.5 tok/s,高於他接手這套方案時的大約 7 tok/s;日常對話場景中速度可以到 14-15 tok/s。在一條較長的程式設計提示下,模型生成了 4,892 tokens,速度為 10.15 tok/s,併產出了一個可執行的單檔案貪吃蛇遊戲。
目前這件事只有這一篇報道,除發帖人自述的測試資料外,材料中沒有第三方復現或其他來源的驗證。
AI 綜合 1 篇報道生成 · 更新於 1 小時前
最新進展有人用基於 llama.cpp 的專家流式方案,在 Windows 上以 UD-IQ3_XXS 量化執行 Qwen3.8-Flash-Next 177B,基準約 11.5 tok/s,高於原方案約 7 tok/s。日常對話能到 14-15 tok/s,一段長程式設計提示生成 4,892 tokens、速度 10.15 tok/s,併產出一個可執行的單檔案貪吃蛇遊戲。硬體為 RTX 5070 12GB、32GB DDR4-2400、Ryzen 5 5600GT 與 PCIe Gen3。

這件事的報道 點標題看原文
有人用基於 llama.cpp 的專家流式方案,在 Windows 上以 UD-IQ3_XXS 量化執行 Qwen3.8-Flash-Next 177B,基準約 11.5 tok/s,高於原方案約 7 tok/s。日常對話能到 14-15 tok/s,一段長程式設計提示生成 4,892 tokens、速度 10.15 tok/s,併產出一個可執行的單檔案貪吃蛇遊戲。硬體為 RTX 5070 12GB、32GB DDR4-2400、Ryzen 5 5600GT 與 PCIe Gen3。
想在小显存单卡上跑大模型的读者可参考这套配置。
Reddit · LocalLLaMAAI 評分 75
同時在說的其他事
- 508輝達釋出 64GB 版 DGX Spark,售價 4999 美元8 個來源
- 494Apple 收緊 macOS 全盤訪問許可權,防範 AI Agent 風險7 個來源
- 367Meta 開源 Muse Gadgets 韌體與 SDK5 個來源
- 246爆微軟釋出 MAI-Transcribe-2-Streaming 即時轉寫模型4 個來源
- 215爆亞馬遜擬將約 80 億美元輝達晶片轉入融資載體3 個來源
- 208Anthropic 投 1 億美元啟動 Claude 工程師學院3 個來源
熱度怎麼算的?瞭解口徑收起
熱度按 48 小時內有多少個獨立來源在說這件事算:同一個來源發多條只算一次,並按 24 小時半衰期衰減,所以排前面的是很多人在說的事。
本頁彙總公開訂閱源,標題與摘要由模型整理,版權歸原作者所有;重要資訊請回原文核對。
- 爆
- 討論快速增加
- 新
- 首報 6 小時內
- 發酵中
- 討論仍在增加
