HaiAI123

全球AI工具精選導航

行業動態
持平

Qwen3.8-27B 本地實測投機解碼達 159 tok/s

2026/10/09 — 10/11 00:18·1 個來源(全部)·1 篇報道(全部)

核心速覽 (Key Takeaways)

  • 一位開發者在本地實測 Qwen3.8-27B,用 Q8 DFlash2 投機解碼配合 LemonSeed Engine 0.5.8,把解碼速度從 14 tok/s 提到 159 tok/s。
  • 據 Reddit 披露的基準資料,Sapphire Radeon AI PRO R9700 上 macOS 測得 159.4 tok/s,Strix Halo 移動平臺為 64.4 tok/s。
  • 文章拆解了草稿樹等技術細節。

事件背景與詳細解讀

2026 年 10 月 9 日,Reddit 社群披露了一組關於 Qwen3.8-27B 本地推理的基準資料,隨後有開發者在掘金髮文記錄並拆解了這套方案。據該文描述,測試者使用 Q8 DFlash2 投機解碼配合 LemonSeed Engine 0.5.8,把解碼速度從 14 tok/s 提升到 159 tok/s。

報道給出的具體數字是:在 Sapphire Radeon AI PRO R9700 上測得 159.4 tok/s,在 Strix Halo 移動平臺上為 64.4 tok/s。作為對照,文章提到在配備 M3 Ultra 的 Mac Studio 上通過 Ollama 執行 Qwen3.8-27B Q4_K_M,模型權重佔用約 17 GB,常規持續生成速度約為 14 tok/s。

文章稱這套提速來自兩層最佳化鏈路:草稿樹驗證,以及 gate/up GEMM 運算元融合。文中還提到對比了軟硬體配置與 llm-bench 基準質量,但摘要中未給出這些對比的具體結果。目前公開的資訊停在這組基準資料與最佳化鏈路的拆解上,材料中沒有更多後續進展。

AI 綜合 1 篇報道生成 · 更新於 2 小時前

最新進展一位開發者在本地實測 Qwen3.8-27B,用 Q8 DFlash2 投機解碼配合 LemonSeed Engine 0.5.8,把解碼速度從 14 tok/s 提到 159 tok/s。據 Reddit 披露的基準資料,Sapphire Radeon AI PRO R9700 上 macOS 測得 159.4 tok/s,Strix Halo 移動平臺為 64.4 tok/s。文章拆解了草稿樹驗證與 gate/up GEMM 運算元融合兩層最佳化鏈路。

相關 AI 工具

24 小時熱度熱度指數 43 · 峰值 84 · 23 小時前
24 小時前現在

這件事的報道 點標題看原文

10月9日
  1. 一位開發者在本地實測 Qwen3.8-27B,用 Q8 DFlash2 投機解碼配合 LemonSeed Engine 0.5.8,把解碼速度從 14 tok/s 提到 159 tok/s。據 Reddit 披露的基準資料,Sapphire Radeon AI PRO R9700 上 macOS 測得 159.4 tok/s,Strix Halo 移動平臺為 64.4 tok/s。文章拆解了草稿樹驗證與 gate/up GEMM 運算元融合兩層最佳化鏈路。

    看清本地 27B 推理提速的實際鏈路與硬體選型成本

    掘金AI 評分 55

同時在說的其他事

熱度怎麼算的?瞭解口徑

熱度按 48 小時內有多少個獨立來源在說這件事算:同一個來源發多條只算一次,並按 24 小時半衰期衰減,所以排前面的是很多人在說的事。

本頁彙總公開訂閱源,標題與摘要由模型整理,版權歸原作者所有;重要資訊請回原文核對。如權利人認為相關標題或摘要侵權,請通過頁尾聯絡郵箱提供具體頁面與權利依據,我們核實後會及時刪除或替換。

爆
討論快速增加
新
首報 6 小時內
發酵中
討論仍在增加

回 AI 行業動態榜 →