Strata 为 llama.cpp 实现 MoE 缓存,预填充提速 5-10 倍
2026/10/03 — 10/03 22:12·1 个来源·1 篇报道
事件概览
2026 年 10 月 3 日,Reddit 的 LocalLLaMA 版块出现一篇帖子,介绍名为 Strata 的社区项目为本地大模型推理工具 llama.cpp 实现了 MoE 缓存。发帖人给出的项目地址为 https://github.com/Niko1221/Strata,并称加入 MoE 缓存后,预填充速度提升 5-10 倍,解码速度提升 3-4 倍。
发帖人在帖中表示,自己大约一年来一直希望 llama.cpp 实现 MoE 缓存,但社区在这项功能上的多个 PR 进展缓慢,多数只是 1%、2% 量级的小幅改进,同时 arXiv 上已有数十篇论文验证了该思路。按其说法,Strata 只用了约两周就做出了这一实现。
目前这件事停在这篇帖子本身:相关数字与两周完成实现的说法均出自发帖人自述,材料中没有 llama.cpp 项目方或其他第三方的回应,也没有独立的复现或评测结果。
AI 综合 1 篇报道生成 · 更新于 1 小时前
最新进展一个名为 Strata 的社区项目称,在本地大模型推理中实现 MoE 缓存后,预填充速度提升 5-10 倍、解码提升 3-4 倍。发帖人表示 llama.cpp 社区一年来在这项功能上的 PR 进展缓慢,而 Strata 约两周就做出实现。
这件事的报道 点标题看原文
一个名为 Strata 的社区项目称,在本地大模型推理中实现 MoE 缓存后,预填充速度提升 5-10 倍、解码提升 3-4 倍。发帖人表示 llama.cpp 社区一年来在这项功能上的 PR 进展缓慢,而 Strata 约两周就做出实现。
关心本地大模型推理速度的人可以留意这个实现。
Reddit · LocalLLaMAAI 评分 64
同时在说的其他事
- 584发酵中Apple 收紧 macOS 全盘访问权限,防范 AI Agent 风险9 个来源
- 415英伟达发布 64GB 版 DGX Spark,售价 4999 美元8 个来源
- 398发酵中Meta 开源 Muse Gadgets 固件与 SDK6 个来源
- 306Opus 5.5 与 GPT-6 Sol 同日发布,每任务成本谁更低4 个来源
- 280发酵中Anthropic 计划感恩节前上市,目标 11 月 9 日5 个来源
- 260新爆OpenAI 安全团队成员 David Robinson 离职撰文示警3 个来源
热度怎么算的?了解口径收起
热度按 48 小时内有多少个独立来源在说这件事算:同一个来源发多条只算一次,并按 24 小时半衰期衰减,所以排前面的是很多人在说的事。
本页汇总公开订阅源,标题与摘要由模型整理,版权归原作者所有;重要信息请回原文核对。
- 爆
- 讨论快速增加
- 新
- 首报 6 小时内
- 发酵中
- 讨论仍在增加
