HaiAI123

全球AI工具精选导航

新热点事件
92
热度指数
新上榜

ninfer 对比 llama.cpp:Qwen3.8 27B 提速 2.3 倍

2026/10/03 — 10/03 18:49·1 个来源·1 篇报道

事件概览

2026 年 10 月 3 日,Reddit 的 LocalLLaMA 版块出现一篇用户自测帖,内容是有人在 RTX 5090 上对比 ninfer 与 llama.cpp 运行 Qwen3.8 27B 的表现。测试条件为:同一提示词(与物理、自旋相关,含完整规则)、120k 上下文、开启 thinking(xhigh)、默认采样设置,单次运行(oneshot)。据帖子摘要,ninfer 解码约 147 tokens/s,llama.cpp(Q4_K_M + MTP)约 141 tokens/s,两者耗时分别为 7 分 40 秒与 8 分 13 秒。帖子作者称,改用 ninfer 的 NVFP4 版本后输出量更大。

值得注意的是,报道标题称 ninfer 相比 llama.cpp 提速 2.3 倍,但摘要中给出的解码速度差距只有约 4%,两处说法并不一致。原文片段显示的表格数据也不完整,只保留了 ninfer 在非 NVFP4 构建下的精度与 MTP 一栏的开头,无法据此核对全部数字。目前这件事只停留在这一篇用户发帖,没有其他来源、后续测试,也没有 ninfer 或 llama.cpp 任何一方的官方说明。

AI 综合 1 篇报道生成 · 更新于 2 小时前

最新进展有用户在 RTX 5090 上对比 ninfer 与 llama.cpp 运行 Qwen3.8 27B:同一提示词、120k 上下文、开启 thinking 的单次测试中,ninfer 解码约 147 tokens/s,llama.cpp(Q4_K_M + MTP)约 141 tokens/s,耗时分别为 7 分 40 秒与 8 分 13 秒。作者称改用 ninfer 的 NVFP4 版本后输出量更大。

24 小时热度峰值 98 · 3 小时前
24 小时前现在

这件事的报道 点标题看原文

今天
  1. 有用户在 RTX 5090 上对比 ninfer 与 llama.cpp 运行 Qwen3.8 27B:同一提示词、120k 上下文、开启 thinking 的单次测试中,ninfer 解码约 147 tokens/s,llama.cpp(Q4_K_M + MTP)约 141 tokens/s,耗时分别为 7 分 40 秒与 8 分 13 秒。作者称改用 ninfer 的 NVFP4 版本后输出量更大。

    想在本机跑大模型的读者可参考这组实测数据。

    Reddit · LocalLLaMAAI 评分 82

同时在说的其他事

热度怎么算的?了解口径

热度按 48 小时内有多少个独立来源在说这件事算:同一个来源发多条只算一次,并按 24 小时半衰期衰减,所以排前面的是很多人在说的事。

本页汇总公开订阅源,标题与摘要由模型整理,版权归原作者所有;重要信息请回原文核对。

爆
讨论快速增加
新
首报 6 小时内
发酵中
讨论仍在增加

回热点事件榜 →