llama.cpp 共享專家融合進 MMVQ 提速 MoE
2026/10/03 — 10/03 03:02·1 個來源·1 篇報道
事件概覽
2026 年 10 月 3 日,Reddit 的 LocalLLaMA 板塊出現一條帖子,提到 llama.cpp 的新 PR #29184。按帖子的說法,這個 PR 把共享專家(shared experts)融合進 MMVQ,從而為部分 MoE 架構帶來推理加速。
帖子由使用者 u/jacek2023 提交,作者在說明中特別註明,這一加速只對特定 MoE 架構生效,並舉例為 Qwen 35B A3B。也就是說,並非所有 MoE 模型都能從中受益,具體適用範圍以作者給出的這個例子為準。
截至目前,這條報道只交代了 PR 編號、改動思路、適用條件和所舉的架構例子。加速幅度是多少、除 Qwen 35B A3B 之外還有哪些 MoE 架構適用、該 PR 是否已經合併或被納入某個版本,材料裡都沒有提及,因此這件事目前停在該 PR 被公開討論、尚未見到後續結論的階段。
AI 綜合 1 篇報道生成 · 更新於 2 小時前
最新進展llama.cpp 的 PR #29184 把共享專家(shared experts)融合進 MMVQ,為部分 MoE 架構帶來推理加速。作者註明加速只對特定 MoE 架構生效,例如 Qwen 35B A3B。

- 熱度指數
- 93
- 獨立來源
- 1
- 報道數
- 1
- 首報
- 2 小時前
這件事的報道 點標題看原文
llama.cpp 的 PR #29184 把共享專家(shared experts)融合進 MMVQ,為部分 MoE 架構帶來推理加速。作者註明加速只對特定 MoE 架構生效,例如 Qwen 35B A3B。
关注 MoE 推理优化的开发者可看
同時在說的其他事
- 593爆輝達釋出 64GB 版 DGX Spark,售價 4999 美元7 個來源
- 466新Apple 收緊 macOS 全盤訪問許可權,防範 AI Agent 風險5 個來源
- 372谷歌釋出 Gemini 4 Argon 模型,定位前沿 AI 能力10 個來源
- 262爆OpenAI DevDay 2026 釋出 Dots、Decisions API 等新品3 個來源
- 248爆Suno 上線語音生成功能,支援旁白與配樂3 個來源
- 212爆微軟釋出 MAI-Transcribe-2-Streaming 即時轉寫模型3 個來源
熱度怎麼算的?瞭解口徑收起
熱度按 48 小時內有多少個獨立來源在說這件事算:同一個來源發多條只算一次,並按 24 小時半衰期衰減,所以排前面的是很多人在說的事。
本頁彙總公開訂閱源,標題與摘要由模型整理,版權歸原作者所有;重要資訊請回原文核對。
- 爆
- 討論快速增加
- 新
- 首報 6 小時內
- 發酵中
- 討論仍在增加
