HaiAI123

全球AI工具精选导航

行业动态
持平

Qwen3.8-27B 本地实测投机解码达 159 tok/s

2026/10/09 — 10/11 00:18·1 个来源(全部)·1 篇报道(全部)

核心速览 (Key Takeaways)

  • 一位开发者在本地实测 Qwen3.8-27B,用 Q8 DFlash2 投机解码配合 LemonSeed Engine 0.5.8,把解码速度从 14 tok/s 提到 159 tok/s。
  • 据 Reddit 披露的基准数据,Sapphire Radeon AI PRO R9700 上 macOS 测得 159.4 tok/s,Strix Halo 移动平台为 64.4 tok/s。
  • 文章拆解了草稿树等技术细节。

事件背景与详细解读

2026 年 10 月 9 日,Reddit 社区披露了一组关于 Qwen3.8-27B 本地推理的基准数据,随后有开发者在掘金发文记录并拆解了这套方案。据该文描述,测试者使用 Q8 DFlash2 投机解码配合 LemonSeed Engine 0.5.8,把解码速度从 14 tok/s 提升到 159 tok/s。

报道给出的具体数字是:在 Sapphire Radeon AI PRO R9700 上测得 159.4 tok/s,在 Strix Halo 移动平台上为 64.4 tok/s。作为对照,文章提到在配备 M3 Ultra 的 Mac Studio 上通过 Ollama 运行 Qwen3.8-27B Q4_K_M,模型权重占用约 17 GB,常规持续生成速度约为 14 tok/s。

文章称这套提速来自两层优化链路:草稿树验证,以及 gate/up GEMM 算子融合。文中还提到对比了软硬件配置与 llm-bench 基准质量,但摘要中未给出这些对比的具体结果。目前公开的信息停在这组基准数据与优化链路的拆解上,材料中没有更多后续进展。

AI 综合 1 篇报道生成 · 更新于 2 小时前

最新进展一位开发者在本地实测 Qwen3.8-27B,用 Q8 DFlash2 投机解码配合 LemonSeed Engine 0.5.8,把解码速度从 14 tok/s 提到 159 tok/s。据 Reddit 披露的基准数据,Sapphire Radeon AI PRO R9700 上 macOS 测得 159.4 tok/s,Strix Halo 移动平台为 64.4 tok/s。文章拆解了草稿树验证与 gate/up GEMM 算子融合两层优化链路。

相关 AI 工具

24 小时热度热度指数 43 · 峰值 84 · 23 小时前
24 小时前现在

这件事的报道 点标题看原文

10月9日
  1. 一位开发者在本地实测 Qwen3.8-27B,用 Q8 DFlash2 投机解码配合 LemonSeed Engine 0.5.8,把解码速度从 14 tok/s 提到 159 tok/s。据 Reddit 披露的基准数据,Sapphire Radeon AI PRO R9700 上 macOS 测得 159.4 tok/s,Strix Halo 移动平台为 64.4 tok/s。文章拆解了草稿树验证与 gate/up GEMM 算子融合两层优化链路。

    看清本地 27B 推理提速的实际链路与硬件选型成本

    掘金AI 评分 55

同时在说的其他事

热度怎么算的?了解口径

热度按 48 小时内有多少个独立来源在说这件事算:同一个来源发多条只算一次,并按 24 小时半衰期衰减,所以排前面的是很多人在说的事。

本页汇总公开订阅源,标题与摘要由模型整理,版权归原作者所有;重要信息请回原文核对。如权利人认为相关标题或摘要侵权,请通过页尾联系邮箱提供具体页面与权利依据,我们核实后会及时删除或替换。

爆
讨论快速增加
新
首报 6 小时内
发酵中
讨论仍在增加

回 AI 行业动态榜 →