llama.cpp 共享专家融合进 MMVQ 提速 MoE
2026/10/03 — 10/03 03:02·1 个来源·1 篇报道
事件概览
2026 年 10 月 3 日,Reddit 的 LocalLLaMA 板块出现一条帖子,提到 llama.cpp 的新 PR #29184。按帖子的说法,这个 PR 把共享专家(shared experts)融合进 MMVQ,从而为部分 MoE 架构带来推理加速。
帖子由用户 u/jacek2023 提交,作者在说明中特别注明,这一加速只对特定 MoE 架构生效,并举例为 Qwen 35B A3B。也就是说,并非所有 MoE 模型都能从中受益,具体适用范围以作者给出的这个例子为准。
截至目前,这条报道只交代了 PR 编号、改动思路、适用条件和所举的架构例子。加速幅度是多少、除 Qwen 35B A3B 之外还有哪些 MoE 架构适用、该 PR 是否已经合并或被纳入某个版本,材料里都没有提及,因此这件事目前停在该 PR 被公开讨论、尚未见到后续结论的阶段。
AI 综合 1 篇报道生成 · 更新于 2 小时前
最新进展llama.cpp 的 PR #29184 把共享专家(shared experts)融合进 MMVQ,为部分 MoE 架构带来推理加速。作者注明加速只对特定 MoE 架构生效,例如 Qwen 35B A3B。

- 热度指数
- 93
- 独立来源
- 1
- 报道数
- 1
- 首报
- 2 小时前
这件事的报道 点标题看原文
llama.cpp 的 PR #29184 把共享专家(shared experts)融合进 MMVQ,为部分 MoE 架构带来推理加速。作者注明加速只对特定 MoE 架构生效,例如 Qwen 35B A3B。
关注 MoE 推理优化的开发者可看
同时在说的其他事
- 593爆英伟达发布 64GB 版 DGX Spark,售价 4999 美元7 个来源
- 466新Apple 收紧 macOS 全盘访问权限,防范 AI Agent 风险5 个来源
- 372谷歌发布 Gemini 4 Argon 模型,定位前沿 AI 能力10 个来源
- 262爆OpenAI DevDay 2026 发布 Dots、Decisions API 等新品3 个来源
- 248爆Suno 上线语音生成功能,支持旁白与配乐3 个来源
- 212爆微软发布 MAI-Transcribe-2-Streaming 实时转写模型3 个来源
热度怎么算的?了解口径收起
热度按 48 小时内有多少个独立来源在说这件事算:同一个来源发多条只算一次,并按 24 小时半衰期衰减,所以排前面的是很多人在说的事。
本页汇总公开订阅源,标题与摘要由模型整理,版权归原作者所有;重要信息请回原文核对。
- 爆
- 讨论快速增加
- 新
- 首报 6 小时内
- 发酵中
- 讨论仍在增加
