ninfer 对比 llama.cpp:Qwen3.8 27B 提速 2.3 倍
2026/10/03 — 10/03 18:49·1 个来源·1 篇报道
事件概览
2026 年 10 月 3 日,Reddit 的 LocalLLaMA 版块出现一篇用户自测帖,内容是有人在 RTX 5090 上对比 ninfer 与 llama.cpp 运行 Qwen3.8 27B 的表现。测试条件为:同一提示词(与物理、自旋相关,含完整规则)、120k 上下文、开启 thinking(xhigh)、默认采样设置,单次运行(oneshot)。据帖子摘要,ninfer 解码约 147 tokens/s,llama.cpp(Q4_K_M + MTP)约 141 tokens/s,两者耗时分别为 7 分 40 秒与 8 分 13 秒。帖子作者称,改用 ninfer 的 NVFP4 版本后输出量更大。
值得注意的是,报道标题称 ninfer 相比 llama.cpp 提速 2.3 倍,但摘要中给出的解码速度差距只有约 4%,两处说法并不一致。原文片段显示的表格数据也不完整,只保留了 ninfer 在非 NVFP4 构建下的精度与 MTP 一栏的开头,无法据此核对全部数字。目前这件事只停留在这一篇用户发帖,没有其他来源、后续测试,也没有 ninfer 或 llama.cpp 任何一方的官方说明。
AI 综合 1 篇报道生成 · 更新于 2 小时前
最新进展有用户在 RTX 5090 上对比 ninfer 与 llama.cpp 运行 Qwen3.8 27B:同一提示词、120k 上下文、开启 thinking 的单次测试中,ninfer 解码约 147 tokens/s,llama.cpp(Q4_K_M + MTP)约 141 tokens/s,耗时分别为 7 分 40 秒与 8 分 13 秒。作者称改用 ninfer 的 NVFP4 版本后输出量更大。
- 热度指数
- 92
- 独立来源
- 1
- 报道数
- 1
- 首报
- 4 小时前
这件事的报道 点标题看原文
有用户在 RTX 5090 上对比 ninfer 与 llama.cpp 运行 Qwen3.8 27B:同一提示词、120k 上下文、开启 thinking 的单次测试中,ninfer 解码约 147 tokens/s,llama.cpp(Q4_K_M + MTP)约 141 tokens/s,耗时分别为 7 分 40 秒与 8 分 13 秒。作者称改用 ninfer 的 NVFP4 版本后输出量更大。
想在本机跑大模型的读者可参考这组实测数据。
Reddit · LocalLLaMAAI 评分 82
同时在说的其他事
- 529发酵中Apple 收紧 macOS 全盘访问权限,防范 AI Agent 风险8 个来源
- 453英伟达发布 64GB 版 DGX Spark,售价 4999 美元8 个来源
- 334爆Opus 5.5 与 GPT-6 Sol 同日发布,每任务成本谁更低4 个来源
- 327Meta 开源 Muse Gadgets 固件与 SDK5 个来源
- 219微软发布 MAI-Transcribe-2-Streaming 实时转写模型4 个来源
- 192亚马逊拟将约 80 亿美元英伟达芯片转入融资载体3 个来源
热度怎么算的?了解口径收起
热度按 48 小时内有多少个独立来源在说这件事算:同一个来源发多条只算一次,并按 24 小时半衰期衰减,所以排前面的是很多人在说的事。
本页汇总公开订阅源,标题与摘要由模型整理,版权归原作者所有;重要信息请回原文核对。
- 爆
- 讨论快速增加
- 新
- 首报 6 小时内
- 发酵中
- 讨论仍在增加
