HaiAI123

全球AI工具精选导航

新热点事件
92
热度指数
新上榜

Kyojin 在单台 128 GB mini PC 跑两个 300B 级 MoE

2026/10/03 — 10/03 23:12·1 个来源·1 篇报道

事件概览

2026 年 10 月 3 日,Reddit 的 LocalLLaMA 板块出现一篇帖子,介绍了一个名为 Kyojin 的推理引擎。据帖子描述,Kyojin 构建在 ExLlamaV3 之上,面向 Strix Halo 平台(gfx1151、ROCm),目标是让两个 300B 级 MoE 模型各自装进一台 128 GB 的 mini PC。

帖子称这是 Kyojin 的首个版本,所有测量都在 Ryzen AI Max+ 395 上完成。两个模型分别是 GLM-5.3-Flash 和 MiMo-V2.6-Flash-MOPD,占用体积为 99.7 GB 和 105 GB。GLM-5.3-Flash 的预填充速度约为 580 tok/s(3.5K 上下文),在 64K 上下文下为 546 tok/s,解码为 26 至 30 tok/s(MTP)。MiMo-V2.6-Flash 在 4K 上下文下的预填充约为 650 tok/s,解码成绩按场景区分:散文 32 tok/s、对话 35 tok/s、代码 44 tok/s(推测解码),另有 29 tok/s 的一档(原文标为 plain)。标题给出的说法是 MiMo-V2.6-Flash 解码最高 44 tok/s。

目前只有这一篇报道,工具的这一版本没有更多来源或后续进展可以核对。

AI 综合 1 篇报道生成 · 更新于 3 小时前

最新进展基于 ExLlamaV3 的推理引擎 Kyojin 在 Ryzen AI Max+ 395 上运行 GLM-5.3-Flash 和 MiMo-V2.6-Flash,两个 300B 级 MoE 模型各装进一台 128 GB 机器。GLM-5.3-Flash 预填充约 580 tok/s(3.5K 上下文),MiMo-V2.6-Flash 解码最高 44 tok/s。

24 小时热度峰值 98 · 2 小时前
24 小时前现在

这件事的报道 点标题看原文

昨天
  1. 基于 ExLlamaV3 的推理引擎 Kyojin 在 Ryzen AI Max+ 395 上运行 GLM-5.3-Flash 和 MiMo-V2.6-Flash,两个 300B 级 MoE 模型各装进一台 128 GB 机器。GLM-5.3-Flash 预填充约 580 tok/s(3.5K 上下文),MiMo-V2.6-Flash 解码最高 44 tok/s。

    想在单机本地跑 300B 级模型,可参考这套引擎与实测数据。

    Reddit · LocalLLaMAAI 评分 85

同时在说的其他事

热度怎么算的?了解口径

热度按 48 小时内有多少个独立来源在说这件事算:同一个来源发多条只算一次,并按 24 小时半衰期衰减,所以排前面的是很多人在说的事。

本页汇总公开订阅源,标题与摘要由模型整理,版权归原作者所有;重要信息请回原文核对。

爆
讨论快速增加
新
首报 6 小时内
发酵中
讨论仍在增加

回热点事件榜 →