MegaCapybara 发布 RTX5090 推理引擎称速度翻倍
2026/10/03 — 10/03 10:12·1 个来源·1 篇报道
事件概览
2026 年 10 月 3 日,一位开发者在 Reddit 的 LocalLLaMA 版块公布了一款名为 MegaCapybara 的推理引擎。据其介绍,这款引擎是专门为 RTX5090 打造的,当前主要面向 Qwen3.8 27B 这一个模型,作者表示后续会支持更多模型。引擎代码发布在 GitHub,权重放在 Hugging Face。
作者给出的核心说法是速度:MegaCapybara 的解码速度约为 Ninfer 的两倍,而 Ninfer 在此之前是 RTX5090 上的 SOTA 引擎,这一倍数在单任务和多任务并发两种情况下都成立。具体数字方面,材料称单路可达 500+ t/s,短时爆发能到 650 t/s,12 路并发时最高 2600 t/s;原文在提到 2600 t/s 时用的说法是「如果一切条件都刚好合适」,而报道摘要把它归到 12 路并发的场景下,两处表述并不完全一致。除此之外,MegaCapybara 支持 800k 上下文,并带有 VRAM-RAM-磁盘三级缓存管理、Loop Guard 以及图形界面。
目前这件事停在新项目公布这一步:上述速度数字均为作者自述,材料中没有给出测试条件,也没有第三方复现或独立评测,MegaCapybara 相对 Ninfer 是否真的达到两倍,尚无法从现有信息中确认。
AI 综合 1 篇报道生成 · 更新于 1 小时前
最新进展开发者发布 MegaCapybara,一款专为 RTX5090 打造、面向 Qwen3.8 27B 的推理引擎,作者称其解码速度约为此前 RTX5090 上 SOTA 的 Ninfer 两倍。单路编码可达 500+ t/s,12 路并发时最高 2600 t/s,支持 800k 上下文,并带 VRAM-RAM-磁盘缓存管理、Loop Guard 和图形界面。

这件事的报道 点标题看原文
开发者发布 MegaCapybara,一款专为 RTX5090 打造、面向 Qwen3.8 27B 的推理引擎,作者称其解码速度约为此前 RTX5090 上 SOTA 的 Ninfer 两倍。单路编码可达 500+ t/s,12 路并发时最高 2600 t/s,支持 800k 上下文,并带 VRAM-RAM-磁盘缓存管理、Loop Guard 和图形界面。
想在单张 RTX5090 上跑本地大模型的可以关注这个引擎。
Reddit · LocalLLaMAAI 评分 78
同时在说的其他事
- 587发酵中英伟达发布 64GB 版 DGX Spark,售价 4999 美元8 个来源
- 571发酵中Apple 收紧 macOS 全盘访问权限,防范 AI Agent 风险7 个来源
- 424爆Meta 开源 Muse Gadgets 固件与 SDK5 个来源
- 248爆亚马逊拟将约 80 亿美元英伟达芯片转入融资载体3 个来源
- 241爆Anthropic 投 1 亿美元启动 Claude 工程师学院3 个来源
- 239爆Hugging Face 开源报告生成模型 AstaBrief3 个来源
热度怎么算的?了解口径收起
热度按 48 小时内有多少个独立来源在说这件事算:同一个来源发多条只算一次,并按 24 小时半衰期衰减,所以排前面的是很多人在说的事。
本页汇总公开订阅源,标题与摘要由模型整理,版权归原作者所有;重要信息请回原文核对。
- 爆
- 讨论快速增加
- 新
- 首报 6 小时内
- 发酵中
- 讨论仍在增加
