2060 笔记本用 Strata 跑约 120B 的 Qwen 3.8 Flash Next
2026/10/03 — 10/03 23:12·1 个来源·1 篇报道
事件概览
2026 年 10 月 3 日,Reddit 的 LocalLLaMA 板块出现一篇帖子,作者称在一台只有 32 GB 内存和 6 GB 显存的 2060 笔记本上,用 Strata 引擎运行约 120B 参数的 Qwen 3.8 Flash Next(q2_0 量化)。据其描述,在 50k 上下文下解码速度约为 10 tok/s;运行配置为 4 bit KV cache、无视觉。
作者表示,他原本预期提示处理大约 30 token/s、解码最多 3 tok/s,理由是完整的 Qwen 3.8 Next 约有 120B 参数(不计 Engrams),而机器只有 32 GB 内存,他以为会因 SSD 交换而慢到几乎停住。实际 10 token/s 的结果让他认为这个引擎确实名副其实。目前这件事停在该帖的分享阶段,没有更多后续进展。
AI 综合 1 篇报道生成 · 更新于 3 小时前
最新进展在只有 32 GB 内存和 6 GB 显存的 2060 笔记本上,用 Strata 引擎跑约 120B 参数的 Qwen 3.8 Flash Next(q2_0 量化),50k 上下文下解码约 10 tok/s。作者原本预期最多 3 tok/s,实际速度超出预期;配置为 4 bit KV cache、无视觉。
- 热度指数
- 91
- 独立来源
- 1
- 报道数
- 1
- 首报
- 4 小时前
这件事的报道 点标题看原文
在只有 32 GB 内存和 6 GB 显存的 2060 笔记本上,用 Strata 引擎跑约 120B 参数的 Qwen 3.8 Flash Next(q2_0 量化),50k 上下文下解码约 10 tok/s。作者原本预期最多 3 tok/s,实际速度超出预期;配置为 4 bit KV cache、无视觉。
低配老设备本地跑大模型的实测参考。
同时在说的其他事
- 552发酵中Apple 收紧 macOS 全盘访问权限,防范 AI Agent 风险9 个来源
- 392英伟达发布 64GB 版 DGX Spark,售价 4999 美元8 个来源
- 376发酵中Meta 开源 Muse Gadgets 固件与 SDK6 个来源
- 289Opus 5.5 与 GPT-6 Sol 同日发布,每任务成本谁更低4 个来源
- 264Anthropic 计划感恩节前上市,目标 11 月 9 日5 个来源
- 249新爆Aleph Alpha 发布 Kolibri-1:78B 参数 MoE,支持 1M 上下文3 个来源
热度怎么算的?了解口径收起
热度按 48 小时内有多少个独立来源在说这件事算:同一个来源发多条只算一次,并按 24 小时半衰期衰减,所以排前面的是很多人在说的事。
本页汇总公开订阅源,标题与摘要由模型整理,版权归原作者所有;重要信息请回原文核对。
- 爆
- 讨论快速增加
- 新
- 首报 6 小时内
- 发酵中
- 讨论仍在增加
