40G 显存 LoRA 微调 Qwen3.8-Flash-Next
2026/10/09 — 10/11 02:16·1 个来源(全部)·1 篇报道(全部)
核心速览 (Key Takeaways)
- 一位开发者在 Reddit 的 LocalLLaMA 版块更新了 LoRA over GGUF 方案,可在 40 GiB 显存、无 CPU offload 的情况下训练 Qwen3.8-Flash-Next(125B-A6B + 51B engram),engram 放在磁盘上也…
- 在 Strix Halo 上以 2048 上下文分片训练为 9.5 s/it,约 200 token/s。
一位开发者在 Reddit 的 LocalLLaMA 版块更新了 LoRA over GGUF 方案,可在 40 GiB 显存、无 CPU offload 的情况下训练 Qwen3.8-Flash-Next(125B-A6B + 51B engram),engram 放在磁盘上也不降低训练速度。在 Strix Halo 上以 2048 上下文分片训练为 9.5 s/it,约 200 token/s。
最新进展一位开发者在 Reddit 的 LocalLLaMA 版块更新了 LoRA over GGUF 方案,可在 40 GiB 显存、无 CPU offload 的情况下训练 Qwen3.8-Flash-Next(125B-A6B + 51B engram),engram 放在磁盘上也不降低训练速度。在 Strix Halo 上以 2048 上下文分片训练为 9.5 s/it,约 200 token/s。
相关 AI 工具
- 热度指数
- 32
- 全部来源
- 1
- 全部报道
- 1
- 首报
- 2 天前
这件事的报道 点标题看原文
一位开发者在 Reddit 的 LocalLLaMA 版块更新了 LoRA over GGUF 方案,可在 40 GiB 显存、无 CPU offload 的情况下训练 Qwen3.8-Flash-Next(125B-A6B + 51B engram),engram 放在磁盘上也不降低训练速度。在 Strix Halo 上以 2048 上下文分片训练为 9.5 s/it,约 200 token/s。
在消费级显存上微调大模型的具体做法
Reddit · LocalLLaMAAI 评分 55
同时在说的其他事
- 热度指数 42Qwen3.8-27B 本地实测投机解码达 159 tok/s1 个来源
- 热度指数 83用户用 Claude Opus 5.5 为 Qwen3.8-27B 写 CUDA megakernel 提速 1.9 倍1 个来源
- 热度指数 94Qwen 开源 Qwen-Image-2.1-Turbo 图像模型2 个来源
- 热度指数 59开发者发布 Basalt 推理引擎,面向 Blackwell 深度调优1 个来源
- 热度指数 27Atomic Agent Desktop 开源上线,可在本地运行 Qwen 和 Gemma1 个来源
热度怎么算的?了解口径收起
热度按 48 小时内有多少个独立来源在说这件事算:同一个来源发多条只算一次,并按 24 小时半衰期衰减,所以排前面的是很多人在说的事。
本页汇总公开订阅源,标题与摘要由模型整理,版权归原作者所有;重要信息请回原文核对。如权利人认为相关标题或摘要侵权,请通过页尾联系邮箱提供具体页面与权利依据,我们核实后会及时删除或替换。
- 爆
- 讨论快速增加
- 新
- 首报 6 小时内
- 发酵中
- 讨论仍在增加
