40G 視訊記憶體 LoRA 微調 Qwen3.8-Flash-Next
2026/10/09 — 10/11 02:16·1 個來源(全部)·1 篇報道(全部)
核心速覽 (Key Takeaways)
- 一位開發者在 Reddit 的 LocalLLaMA 版塊更新了 LoRA over GGUF 方案,可在 40 GiB 視訊記憶體、無 CPU offload 的情況下訓練 Qwen3.8-Flash-Next(125B-A6B + 51B engram),engram 放在磁…
- 在 Strix Halo 上以 2048 上下文分片訓練為 9.5 s/it,約 200 token/s。
一位開發者在 Reddit 的 LocalLLaMA 版塊更新了 LoRA over GGUF 方案,可在 40 GiB 視訊記憶體、無 CPU offload 的情況下訓練 Qwen3.8-Flash-Next(125B-A6B + 51B engram),engram 放在磁碟上也不降低訓練速度。在 Strix Halo 上以 2048 上下文分片訓練為 9.5 s/it,約 200 token/s。
最新進展一位開發者在 Reddit 的 LocalLLaMA 版塊更新了 LoRA over GGUF 方案,可在 40 GiB 視訊記憶體、無 CPU offload 的情況下訓練 Qwen3.8-Flash-Next(125B-A6B + 51B engram),engram 放在磁碟上也不降低訓練速度。在 Strix Halo 上以 2048 上下文分片訓練為 9.5 s/it,約 200 token/s。
相關 AI 工具
- 熱度指數
- 32
- 全部來源
- 1
- 全部報道
- 1
- 首報
- 2 天前
這件事的報道 點標題看原文
一位開發者在 Reddit 的 LocalLLaMA 版塊更新了 LoRA over GGUF 方案,可在 40 GiB 視訊記憶體、無 CPU offload 的情況下訓練 Qwen3.8-Flash-Next(125B-A6B + 51B engram),engram 放在磁碟上也不降低訓練速度。在 Strix Halo 上以 2048 上下文分片訓練為 9.5 s/it,約 200 token/s。
在消費級視訊記憶體上微調大模型的具體做法
Reddit · LocalLLaMAAI 評分 55
同時在說的其他事
- 熱度指數 42Qwen3.8-27B 本地實測投機解碼達 159 tok/s1 個來源
- 熱度指數 83使用者用 Claude Opus 5.5 為 Qwen3.8-27B 寫 CUDA megakernel 提速 1.9 倍1 個來源
- 熱度指數 94Qwen 開源 Qwen-Image-2.1-Turbo 影像模型2 個來源
- 熱度指數 59開發者釋出 Basalt 推理引擎,面向 Blackwell 深度調優1 個來源
- 熱度指數 27Atomic Agent Desktop 開源上線,可在本地執行 Qwen 和 Gemma1 個來源
熱度怎麼算的?瞭解口徑收起
熱度按 48 小時內有多少個獨立來源在說這件事算:同一個來源發多條只算一次,並按 24 小時半衰期衰減,所以排前面的是很多人在說的事。
本頁彙總公開訂閱源,標題與摘要由模型整理,版權歸原作者所有;重要資訊請回原文核對。如權利人認為相關標題或摘要侵權,請通過頁尾聯絡郵箱提供具體頁面與權利依據,我們核實後會及時刪除或替換。
- 爆
- 討論快速增加
- 新
- 首報 6 小時內
- 發酵中
- 討論仍在增加
