单条实测记录
Qwen3-14B · Q6_K
在 rtx_4080_super 上, 用 ollama 0.5.1 跑出来的读数。 下面每一项都来自这条记录本身——我们没有替它补过任何字段。
这条记录的全部字段
— 的意思是来源没说这一项——不是「关」,也不是「0」。
记录里没有的字段我们也列出来,那样你才看得出这是我们的缺口,而不是这一页不问它。
完整配置
上下文长度—
KV cache—
flash attention—
batch—
GPU 层数-1
显存峰值 GB14.8
显存总量—
样本量15
复现次数0
硬件rtx_4080_super
模型Qwen3-14B
量化Q6_K
投机解码—
并发数—
上下文扩展—
证据级别L1 已复现
测量方站方自产
配置签名effd3db70d7240f2e0e8ccc42655b784c09d028026dc2c077013f5fdee37dedb
复现链—
窄屏隐藏的列
框架ollama 0.5.1
prefill tok/s1229
TTFT 冷启 ms5592
decode tok/s36.7
归一化未命中hardware: rtx_4080_super;quant: Q6_K
TTFT 热启 ms—
整机功耗 W—
MTP 接受率—
KLD—
原始来源
平台GitHub
抓取时间19 小时前
状态稳定
原文快照—
我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。
相关断言
目前没有断言引用这条记录
「稳定」已被独立来源复现过,当前没有已知分歧。
复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。
用同样的配置跑一遍
这段是本站按上面这些字段拼出来的,不是来源帖子的原文——来源里通常只有半条命令行或一张截图。 参数相同不代表环境相同:你的驱动、系统、后台占用都会影响结果,我们不承诺你能跑到同样的速度。
这条记录 · ollama 0.5.1
ollama run Qwen3-14B:Q6_K
「跑完把结果交回来」这个入口(投稿)还没有上线。现在能做的只有把配置抄走,到自己的机器上跑一遍。
这一页怎么读
-
—的意思是来源没说这一项,不是「关」,也不是「0」。 反过来,「否」是一个值:那是来源明确写了关闭。两件事我们分开渲染。 -
没有样本量的记录,指标一律显示
—。一个不知道是几次跑出来的速度, 不能拿来照着抄。这条纪律在表格、导出、展开体和这一页四处完全一致。 - 「跑不动」的记录指标照常显示。那正是"跑不动"的依据——比如显存峰值超过了这台 机器的总量。把指标藏起来,结论就变成了没有依据的断言。
- 原文快照我们没有。只存了来源链接与抓取时间。来源被删或改版后, 这一页保留的是当时的读数,无法再对上原文——这是我们的缺口,不是你的。
- 一条记录只是一个读数,不是一条结论。同一个组合下的不同记录可能差出一倍 (框架、驱动、后台占用都会影响)。要判断"该用哪个配置", 看「怎么配」那一页的对照,而不是只看这一条。