HaiAI123

全球AI工具精选导航

新热点事件
95
热度指数
新上榜

MegaCapybara 发布 RTX5090 推理引擎称速度翻倍

2026/10/03 — 10/03 10:12·1 个来源·1 篇报道

事件概览

2026 年 10 月 3 日,一位开发者在 Reddit 的 LocalLLaMA 版块公布了一款名为 MegaCapybara 的推理引擎。据其介绍,这款引擎是专门为 RTX5090 打造的,当前主要面向 Qwen3.8 27B 这一个模型,作者表示后续会支持更多模型。引擎代码发布在 GitHub,权重放在 Hugging Face。

作者给出的核心说法是速度:MegaCapybara 的解码速度约为 Ninfer 的两倍,而 Ninfer 在此之前是 RTX5090 上的 SOTA 引擎,这一倍数在单任务和多任务并发两种情况下都成立。具体数字方面,材料称单路可达 500+ t/s,短时爆发能到 650 t/s,12 路并发时最高 2600 t/s;原文在提到 2600 t/s 时用的说法是「如果一切条件都刚好合适」,而报道摘要把它归到 12 路并发的场景下,两处表述并不完全一致。除此之外,MegaCapybara 支持 800k 上下文,并带有 VRAM-RAM-磁盘三级缓存管理、Loop Guard 以及图形界面。

目前这件事停在新项目公布这一步:上述速度数字均为作者自述,材料中没有给出测试条件,也没有第三方复现或独立评测,MegaCapybara 相对 Ninfer 是否真的达到两倍,尚无法从现有信息中确认。

AI 综合 1 篇报道生成 · 更新于 1 小时前

最新进展开发者发布 MegaCapybara,一款专为 RTX5090 打造、面向 Qwen3.8 27B 的推理引擎,作者称其解码速度约为此前 RTX5090 上 SOTA 的 Ninfer 两倍。单路编码可达 500+ t/s,12 路并发时最高 2600 t/s,支持 800k 上下文,并带 VRAM-RAM-磁盘缓存管理、Loop Guard 和图形界面。

这件事的报道 点标题看原文

今天
  1. 开发者发布 MegaCapybara,一款专为 RTX5090 打造、面向 Qwen3.8 27B 的推理引擎,作者称其解码速度约为此前 RTX5090 上 SOTA 的 Ninfer 两倍。单路编码可达 500+ t/s,12 路并发时最高 2600 t/s,支持 800k 上下文,并带 VRAM-RAM-磁盘缓存管理、Loop Guard 和图形界面。

    想在单张 RTX5090 上跑本地大模型的可以关注这个引擎。

    Reddit · LocalLLaMAAI 评分 78

同时在说的其他事

热度怎么算的?了解口径

热度按 48 小时内有多少个独立来源在说这件事算:同一个来源发多条只算一次,并按 24 小时半衰期衰减,所以排前面的是很多人在说的事。

本页汇总公开订阅源,标题与摘要由模型整理,版权归原作者所有;重要信息请回原文核对。

爆
讨论快速增加
新
首报 6 小时内
发酵中
讨论仍在增加

回热点事件榜 →