Kyojin 在单台 128 GB mini PC 跑两个 300B 级 MoE
2026/10/03 — 10/03 23:12·1 个来源·1 篇报道
事件概览
2026 年 10 月 3 日,Reddit 的 LocalLLaMA 板块出现一篇帖子,介绍了一个名为 Kyojin 的推理引擎。据帖子描述,Kyojin 构建在 ExLlamaV3 之上,面向 Strix Halo 平台(gfx1151、ROCm),目标是让两个 300B 级 MoE 模型各自装进一台 128 GB 的 mini PC。
帖子称这是 Kyojin 的首个版本,所有测量都在 Ryzen AI Max+ 395 上完成。两个模型分别是 GLM-5.3-Flash 和 MiMo-V2.6-Flash-MOPD,占用体积为 99.7 GB 和 105 GB。GLM-5.3-Flash 的预填充速度约为 580 tok/s(3.5K 上下文),在 64K 上下文下为 546 tok/s,解码为 26 至 30 tok/s(MTP)。MiMo-V2.6-Flash 在 4K 上下文下的预填充约为 650 tok/s,解码成绩按场景区分:散文 32 tok/s、对话 35 tok/s、代码 44 tok/s(推测解码),另有 29 tok/s 的一档(原文标为 plain)。标题给出的说法是 MiMo-V2.6-Flash 解码最高 44 tok/s。
目前只有这一篇报道,工具的这一版本没有更多来源或后续进展可以核对。
AI 综合 1 篇报道生成 · 更新于 3 小时前
最新进展基于 ExLlamaV3 的推理引擎 Kyojin 在 Ryzen AI Max+ 395 上运行 GLM-5.3-Flash 和 MiMo-V2.6-Flash,两个 300B 级 MoE 模型各装进一台 128 GB 机器。GLM-5.3-Flash 预填充约 580 tok/s(3.5K 上下文),MiMo-V2.6-Flash 解码最高 44 tok/s。
- 热度指数
- 92
- 独立来源
- 1
- 报道数
- 1
- 首报
- 3 小时前
这件事的报道 点标题看原文
基于 ExLlamaV3 的推理引擎 Kyojin 在 Ryzen AI Max+ 395 上运行 GLM-5.3-Flash 和 MiMo-V2.6-Flash,两个 300B 级 MoE 模型各装进一台 128 GB 机器。GLM-5.3-Flash 预填充约 580 tok/s(3.5K 上下文),MiMo-V2.6-Flash 解码最高 44 tok/s。
想在单机本地跑 300B 级模型,可参考这套引擎与实测数据。
Reddit · LocalLLaMAAI 评分 85
同时在说的其他事
- 552发酵中Apple 收紧 macOS 全盘访问权限,防范 AI Agent 风险9 个来源
- 392英伟达发布 64GB 版 DGX Spark,售价 4999 美元8 个来源
- 376发酵中Meta 开源 Muse Gadgets 固件与 SDK6 个来源
- 289Opus 5.5 与 GPT-6 Sol 同日发布,每任务成本谁更低4 个来源
- 264Anthropic 计划感恩节前上市,目标 11 月 9 日5 个来源
- 249爆Aleph Alpha 发布 Kolibri-1:78B 参数 MoE,支持 1M 上下文3 个来源
热度怎么算的?了解口径收起
热度按 48 小时内有多少个独立来源在说这件事算:同一个来源发多条只算一次,并按 24 小时半衰期衰减,所以排前面的是很多人在说的事。
本页汇总公开订阅源,标题与摘要由模型整理,版权归原作者所有;重要信息请回原文核对。
- 爆
- 讨论快速增加
- 新
- 首报 6 小时内
- 发酵中
- 讨论仍在增加
