Qwen3.8-Flash-Next 177B 单张 RTX 5070 跑出 11-15 tok/s
2026/10/03 — 10/03 15:12·1 个来源·1 篇报道
事件概览
2026 年 10 月 3 日,Reddit 的 LocalLLaMA 版块出现一篇关于本地推理的帖子。发帖人表示,自己一直在 Windows 上调试一套基于 llama.cpp 的专家流式方案,用来运行 Qwen3.8-Flash-Next 177B,量化格式为 UD-IQ3_XXS。硬件是单张 RTX 5070,显存 12GB,搭配 32GB DDR4-2400 内存、Ryzen 5 5600GT 处理器和 PCIe Gen3 接口。按帖子标题的说法,这套配置的速度区间是 11-15 tok/s。
帖子给出了几组具体数字:基准测试约为 11.5 tok/s,高于他接手这套方案时的大约 7 tok/s;日常对话场景中速度可以到 14-15 tok/s。在一条较长的编程提示下,模型生成了 4,892 tokens,速度为 10.15 tok/s,并产出了一个可运行的单文件贪吃蛇游戏。
目前这件事只有这一篇报道,除发帖人自述的测试数据外,材料中没有第三方复现或其他来源的验证。
AI 综合 1 篇报道生成 · 更新于 1 小时前
最新进展有人用基于 llama.cpp 的专家流式方案,在 Windows 上以 UD-IQ3_XXS 量化运行 Qwen3.8-Flash-Next 177B,基准约 11.5 tok/s,高于原方案约 7 tok/s。日常对话能到 14-15 tok/s,一段长编程提示生成 4,892 tokens、速度 10.15 tok/s,并产出一个可运行的单文件贪吃蛇游戏。硬件为 RTX 5070 12GB、32GB DDR4-2400、Ryzen 5 5600GT 与 PCIe Gen3。

这件事的报道 点标题看原文
有人用基于 llama.cpp 的专家流式方案,在 Windows 上以 UD-IQ3_XXS 量化运行 Qwen3.8-Flash-Next 177B,基准约 11.5 tok/s,高于原方案约 7 tok/s。日常对话能到 14-15 tok/s,一段长编程提示生成 4,892 tokens、速度 10.15 tok/s,并产出一个可运行的单文件贪吃蛇游戏。硬件为 RTX 5070 12GB、32GB DDR4-2400、Ryzen 5 5600GT 与 PCIe Gen3。
想在小显存单卡上跑大模型的读者可参考这套配置。
Reddit · LocalLLaMAAI 评分 75
同时在说的其他事
- 508英伟达发布 64GB 版 DGX Spark,售价 4999 美元8 个来源
- 494Apple 收紧 macOS 全盘访问权限,防范 AI Agent 风险7 个来源
- 367Meta 开源 Muse Gadgets 固件与 SDK5 个来源
- 246爆微软发布 MAI-Transcribe-2-Streaming 实时转写模型4 个来源
- 215爆亚马逊拟将约 80 亿美元英伟达芯片转入融资载体3 个来源
- 208Anthropic 投 1 亿美元启动 Claude 工程师学院3 个来源
热度怎么算的?了解口径收起
热度按 48 小时内有多少个独立来源在说这件事算:同一个来源发多条只算一次,并按 24 小时半衰期衰减,所以排前面的是很多人在说的事。
本页汇总公开订阅源,标题与摘要由模型整理,版权归原作者所有;重要信息请回原文核对。
- 爆
- 讨论快速增加
- 新
- 首报 6 小时内
- 发酵中
- 讨论仍在增加
