单条实测记录
meta-llama/Llama-3.1-8B-Instruct · Q8_0
在 Apple M3 Max · 128G 统一内存 上, 用 vLLM 0.6.2 跑出来的读数。 下面每一项都来自这条记录本身——我们没有替它补过任何字段。
这条记录的全部字段
— 的意思是来源没说这一项——不是「关」,也不是「0」。
记录里没有的字段我们也列出来,那样你才看得出这是我们的缺口,而不是这一页不问它。
完整配置
上下文长度—
KV cache—
flash attention—
batch—
GPU 层数-1
显存峰值 GB11.3
显存总量—
样本量5
复现次数0
硬件Apple M3 Max · 128G 统一内存
模型meta-llama/Llama-3.1-8B-Instruct
量化Q8_0
投机解码—
并发数—
上下文扩展—
证据级别L1 已复现
测量方站方自产
配置签名79b2a51fcd3d178d1ee5d2070e329d3c7d87f872c24c0e50788a3e6c9881e436
复现链—
窄屏隐藏的列
框架vLLM 0.6.2
prefill tok/s1142
TTFT 冷启 ms4322
decode tok/s32.7
归一化未命中model: meta-llama/Llama-3.1-8B-Instruct
TTFT 热启 ms—
整机功耗 W—
MTP 接受率—
KLD—
原始来源
平台HuggingFace
抓取时间19 小时前
状态待复现
原文快照—
我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。
相关断言
目前没有断言引用这条记录
「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。
复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。
用同样的配置跑一遍
这段是本站按上面这些字段拼出来的,不是来源帖子的原文——来源里通常只有半条命令行或一张截图。 参数相同不代表环境相同:你的驱动、系统、后台占用都会影响结果,我们不承诺你能跑到同样的速度。
这条记录 · vLLM 0.6.2
vllm serve --model meta-llama/Llama-3.1-8B-Instruct --quant Q8_0 --n-gpu-layers -1
「跑完把结果交回来」这个入口(投稿)还没有上线。现在能做的只有把配置抄走,到自己的机器上跑一遍。
这一页怎么读
-
—的意思是来源没说这一项,不是「关」,也不是「0」。 反过来,「否」是一个值:那是来源明确写了关闭。两件事我们分开渲染。 -
没有样本量的记录,指标一律显示
—。一个不知道是几次跑出来的速度, 不能拿来照着抄。这条纪律在表格、导出、展开体和这一页四处完全一致。 - 「跑不动」的记录指标照常显示。那正是"跑不动"的依据——比如显存峰值超过了这台 机器的总量。把指标藏起来,结论就变成了没有依据的断言。
- 原文快照我们没有。只存了来源链接与抓取时间。来源被删或改版后, 这一页保留的是当时的读数,无法再对上原文——这是我们的缺口,不是你的。
- 一条记录只是一个读数,不是一条结论。同一个组合下的不同记录可能差出一倍 (框架、驱动、后台占用都会影响)。要判断"该用哪个配置", 看「怎么配」那一页的对照,而不是只看这一条。