Kyojin 在單臺 128 GB mini PC 跑兩個 300B 級 MoE
2026/10/03 — 10/03 23:12·1 個來源·1 篇報道
事件概覽
2026 年 10 月 3 日,Reddit 的 LocalLLaMA 板塊出現一篇帖子,介紹了一個名為 Kyojin 的推理引擎。據帖子描述,Kyojin 構建在 ExLlamaV3 之上,面向 Strix Halo 平臺(gfx1151、ROCm),目標是讓兩個 300B 級 MoE 模型各自裝進一臺 128 GB 的 mini PC。
帖子稱這是 Kyojin 的首個版本,所有測量都在 Ryzen AI Max+ 395 上完成。兩個模型分別是 GLM-5.3-Flash 和 MiMo-V2.6-Flash-MOPD,佔用體積為 99.7 GB 和 105 GB。GLM-5.3-Flash 的預填充速度約為 580 tok/s(3.5K 上下文),在 64K 上下文下為 546 tok/s,解碼為 26 至 30 tok/s(MTP)。MiMo-V2.6-Flash 在 4K 上下文下的預填充約為 650 tok/s,解碼成績按場景區分:散文 32 tok/s、對話 35 tok/s、程式碼 44 tok/s(推測解碼),另有 29 tok/s 的一檔(原文標為 plain)。標題給出的說法是 MiMo-V2.6-Flash 解碼最高 44 tok/s。
目前只有這一篇報道,工具的這一版本沒有更多來源或後續進展可以核對。
AI 綜合 1 篇報道生成 · 更新於 3 小時前
最新進展基於 ExLlamaV3 的推理引擎 Kyojin 在 Ryzen AI Max+ 395 上執行 GLM-5.3-Flash 和 MiMo-V2.6-Flash,兩個 300B 級 MoE 模型各裝進一臺 128 GB 機器。GLM-5.3-Flash 預填充約 580 tok/s(3.5K 上下文),MiMo-V2.6-Flash 解碼最高 44 tok/s。
- 熱度指數
- 92
- 獨立來源
- 1
- 報道數
- 1
- 首報
- 3 小時前
這件事的報道 點標題看原文
基於 ExLlamaV3 的推理引擎 Kyojin 在 Ryzen AI Max+ 395 上執行 GLM-5.3-Flash 和 MiMo-V2.6-Flash,兩個 300B 級 MoE 模型各裝進一臺 128 GB 機器。GLM-5.3-Flash 預填充約 580 tok/s(3.5K 上下文),MiMo-V2.6-Flash 解碼最高 44 tok/s。
想在单机本地跑 300B 级模型,可参考这套引擎与实测数据。
Reddit · LocalLLaMAAI 評分 85
同時在說的其他事
- 552發酵中Apple 收緊 macOS 全盤訪問許可權,防範 AI Agent 風險9 個來源
- 392輝達釋出 64GB 版 DGX Spark,售價 4999 美元8 個來源
- 376發酵中Meta 開源 Muse Gadgets 韌體與 SDK6 個來源
- 289Opus 5.5 與 GPT-6 Sol 同日釋出,每任務成本誰更低4 個來源
- 264Anthropic 計劃感恩節前上市,目標 11 月 9 日5 個來源
- 249新爆Aleph Alpha 釋出 Kolibri-1:78B 引數 MoE,支援 1M 上下文3 個來源
熱度怎麼算的?瞭解口徑收起
熱度按 48 小時內有多少個獨立來源在說這件事算:同一個來源發多條只算一次,並按 24 小時半衰期衰減,所以排前面的是很多人在說的事。
本頁彙總公開訂閱源,標題與摘要由模型整理,版權歸原作者所有;重要資訊請回原文核對。
- 爆
- 討論快速增加
- 新
- 首報 6 小時內
- 發酵中
- 討論仍在增加
