Qwen3.8-27B 本地實測投機解碼達 159 tok/s
2026/10/09 — 10/11 00:18·1 個來源(全部)·1 篇報道(全部)
核心速覽 (Key Takeaways)
- 一位開發者在本地實測 Qwen3.8-27B,用 Q8 DFlash2 投機解碼配合 LemonSeed Engine 0.5.8,把解碼速度從 14 tok/s 提到 159 tok/s。
- 據 Reddit 披露的基準資料,Sapphire Radeon AI PRO R9700 上 macOS 測得 159.4 tok/s,Strix Halo 移動平臺為 64.4 tok/s。
- 文章拆解了草稿樹等技術細節。
事件背景與詳細解讀
2026 年 10 月 9 日,Reddit 社群披露了一組關於 Qwen3.8-27B 本地推理的基準資料,隨後有開發者在掘金髮文記錄並拆解了這套方案。據該文描述,測試者使用 Q8 DFlash2 投機解碼配合 LemonSeed Engine 0.5.8,把解碼速度從 14 tok/s 提升到 159 tok/s。
報道給出的具體數字是:在 Sapphire Radeon AI PRO R9700 上測得 159.4 tok/s,在 Strix Halo 移動平臺上為 64.4 tok/s。作為對照,文章提到在配備 M3 Ultra 的 Mac Studio 上通過 Ollama 執行 Qwen3.8-27B Q4_K_M,模型權重佔用約 17 GB,常規持續生成速度約為 14 tok/s。
文章稱這套提速來自兩層最佳化鏈路:草稿樹驗證,以及 gate/up GEMM 運算元融合。文中還提到對比了軟硬體配置與 llm-bench 基準質量,但摘要中未給出這些對比的具體結果。目前公開的資訊停在這組基準資料與最佳化鏈路的拆解上,材料中沒有更多後續進展。
AI 綜合 1 篇報道生成 · 更新於 2 小時前
最新進展一位開發者在本地實測 Qwen3.8-27B,用 Q8 DFlash2 投機解碼配合 LemonSeed Engine 0.5.8,把解碼速度從 14 tok/s 提到 159 tok/s。據 Reddit 披露的基準資料,Sapphire Radeon AI PRO R9700 上 macOS 測得 159.4 tok/s,Strix Halo 移動平臺為 64.4 tok/s。文章拆解了草稿樹驗證與 gate/up GEMM 運算元融合兩層最佳化鏈路。
相關 AI 工具
- 熱度指數
- 43
- 全部來源
- 1
- 全部報道
- 1
- 首報
- 1 天前
這件事的報道 點標題看原文
一位開發者在本地實測 Qwen3.8-27B,用 Q8 DFlash2 投機解碼配合 LemonSeed Engine 0.5.8,把解碼速度從 14 tok/s 提到 159 tok/s。據 Reddit 披露的基準資料,Sapphire Radeon AI PRO R9700 上 macOS 測得 159.4 tok/s,Strix Halo 移動平臺為 64.4 tok/s。文章拆解了草稿樹驗證與 gate/up GEMM 運算元融合兩層最佳化鏈路。
看清本地 27B 推理提速的實際鏈路與硬體選型成本
掘金AI 評分 55
同時在說的其他事
- 熱度指數 86新使用者用 Claude Opus 5.5 為 Qwen3.8-27B 寫 CUDA megakernel 提速 1.9 倍1 個來源
- 熱度指數 3340G 視訊記憶體 LoRA 微調 Qwen3.8-Flash-Next1 個來源
- 熱度指數 28Atomic Agent Desktop 開源上線,可在本地執行 Qwen 和 Gemma1 個來源
- 熱度指數 97Qwen 開源 Qwen-Image-2.1-Turbo 影像模型2 個來源
- 熱度指數 61開發者釋出 Basalt 推理引擎,面向 Blackwell 深度調優1 個來源
熱度怎麼算的?瞭解口徑收起
熱度按 48 小時內有多少個獨立來源在說這件事算:同一個來源發多條只算一次,並按 24 小時半衰期衰減,所以排前面的是很多人在說的事。
本頁彙總公開訂閱源,標題與摘要由模型整理,版權歸原作者所有;重要資訊請回原文核對。如權利人認為相關標題或摘要侵權,請通過頁尾聯絡郵箱提供具體頁面與權利依據,我們核實後會及時刪除或替換。
- 爆
- 討論快速增加
- 新
- 首報 6 小時內
- 發酵中
- 討論仍在增加
