把几个配置,摆在一张表上
两种问法:同一个模型在哪张卡上更快,和同一台机器上哪个框架更快。 表里每一列是一个对比项,每一行是一个指标,数字是中位数,后面跟着支撑它的样本量。 结论只对我们库里这些记录成立——跨硬件不可比,这里做的是数量级参考,不是横评。
先选比什么
最多 6 个对比项两种模式问的是两件不同的事:同一个模型在哪张卡上更快, 和同一台机器上哪个后端更快。换模式等于换一个问题,基准与对比项都不沿用。
这些记录不足以支撑一个排序结论:只有 1 个对比项(llama.cpp)有可用的 decode 中位数——一个数排不出高低。
同一台机器上不同框架的默认参数、batch size 与版本都可能不同——这里比的是记录,不是框架本身。
能不能放在一起看
逐项核对 6 项 · 另有 1 项是你选来对比的判据是这 7 项:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数;你选来对比的那一维(框架(含版本))本来就不一样,所以不计入差异数。门槛(写在这里,你可以自己核对):0 维不同 → 可直接比较;1–2 维不同 → 方向性可比;≥3 维不同 → 不可比。「未核对」不是「一致」:只有一侧有值、或某一列的记录没全登记,一律不给绿灯;双方都没有值的维度会单独点名,也不算一致。门槛要求至少 1 项确认一致,所以"什么都不知道"也不会是绿灯。
不建议直接比较:有 2 项不同 —— 模型(Qwen3-32B / DeepSeek-R1-Distill-Qwen-14B · 未归一化 / phi-4 · 未归一化)、量化(AWQ 4-bit / Q4_K_M / Q5_K_M / Q8_0)。3 项双方都没有值(上下文长度、batch、并发数)—— 它们是「未核对」,不是「一致」。把它们摆在一张表上只能当数量级参考,差额不能算到你想比的那一维头上。
这是两道独立的闸:上面那一道问「能不能排序」(样本量与证据级别够不够), 这一道问「能不能放在一起看」(条件是否一致)。两个都过,这几个数字才谈得上可比。
点一下加入对比,再点一下移出。括号里的数字是点下去会得到几条记录 (所以 0 意味着这个组合我们还没收录,不是它跑不了)。
横向对比 · 同一硬件 × 多框架
基准:Apple M3 Max · 128G 统一内存 · 1 个对比项四个指标都取中位数,而且只统计有有效样本量的记录 (没有 n 的记录在任何一格都不参与)。decode 与 prefill 越高越快,TTFT 与显存峰值越低越好。 每一格后面的小字是支撑这个数字的样本量;最下面两行是整列的证据级别与样本量合计。 排序结论只对「我们库里这些记录」成立,不构成对硬件或框架能力的判断。
| 指标 | llama.cpp · 4 条记录 |
|---|---|
| decode越高越好 | 14.4tok/sn=56 |
| prefill越高越好 | 489tok/sn=56 |
| TTFT 冷启越低越好 | 7879msn=56 |
| 显存峰值越低越好 | 21.1GBn=56 |
| 证据 | L0 自报 |
| n整列样本量合计 | 56 |
参与这次对比的全部记录4 条记录 · 含跑不通的
参与这次对比的全部记录
4 条 · 最快的排前面本次对比涉及的记录一条不落,每条都带证据级别与样本量,展开可以看到完整字段。
phi-4 · 未归一化AWQ 4-bit llama.cpp b5980知乎最后入库 1 天前n=13 30.2 1018 4061 — L0 自报 待复现 稳定
「稳定」已被独立来源复现过,当前没有已知分歧。
复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。
要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。
完整配置 · 来源 · 复现链 16 项
24b35ba3cf56e28d668b8f48b5acadc6f0a26c8b1bfb4e88356985842af319f2快照长度 102 字符(按码点计)我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。
目前没有断言引用这条记录
高级元数据 5 项
DeepSeek-R1-Distill-Qwen-14B · 未归一化Q8_0 llama.cpp b5980Reddit最后入库 1 天前n=15 16.0 539 6978 — L0 自报 待复现 稳定
「稳定」已被独立来源复现过,当前没有已知分歧。
复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。
要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。
完整配置 · 来源 · 复现链 16 项
50c5a4dc67ccf38b8cd57b568b0c89bf8d374dc8b9c0af05d969470f169d51c5快照长度 119 字符(按码点计)我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。
目前没有断言引用这条记录
高级元数据 5 项
Qwen3-32BQ4_K_M llama.cpp b6120Arao 自产最后入库 1 天前n=16 12.9 439 8780 — L0 自报 待复现 稳定
「稳定」已被独立来源复现过,当前没有已知分歧。
复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。
要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。
完整配置 · 来源 · 复现链 16 项
9612fc08f49fc9c539e049eb6d17e7fb88f0a099cec67c48404b51e3027b3c0c快照长度 98 字符(按码点计)我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。
目前没有断言引用这条记录
高级元数据 5 项
Qwen3-32BQ5_K_M llama.cpp b5980Arao 自产最后入库 1 天前n=12 10.6 358 10113 — L0 自报 待复现 稳定
「稳定」已被独立来源复现过,当前没有已知分歧。
复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。
要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。
完整配置 · 来源 · 复现链 16 项
40879ee3def7791add4e838fc4621635fda46e861bb8838f7f10db7323a8eda2快照长度 98 字符(按码点计)我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。
目前没有断言引用这条记录
高级元数据 5 项
这一页怎么比的为什么用中位数 · 排序为什么要两道闸 · 为什么不给排序下强结论 · 上限是多少
这一页怎么比的
- 四个指标都取中位数,而且只统计有有效样本量的记录。中位数对个别离群值不敏感; 没有样本量的记录在任何一格都不参与——一个没有 n 的统计值和编出来的数字没有区别。 每一格后面的小字就是支撑它的样本量。
- 排序只看 decode 中位数,而且有两道闸。要给出「谁的 decode 中位数最高」这句话, 最高那一项必须至少 n≥3、证据级别至少 L1。单次观测排不出高低, 自报数字排出来的顺序也不构成可比性。任何一条不满足,这一页就直接说 「这些记录不足以支撑一个排序结论」——不硬指定谁更高。
- 这里不给排序下强结论。跨硬件不可比,只做数量级参考:不同厂商、不同后端、 不同 batch size 的数字放在一张表里,能回答的是「差几倍」,不是「谁更强」。 买哪张卡、用哪个框架,还要看你的预算、你的模型和你的耐心——那些都不在这张表里。
- 对比项有数量上限。超过上限的网址会被拒绝(返回 400 页并说明超了几个), 而不是悄悄丢掉多余的项——那种"看起来筛了、其实没筛"的失败最难发现。 上限写在页面上方的模式切换那一块里,数字取自代码里的同一个常量。
- 每个对比项都能点进去。列头是链接,指向数据页里筛好的那份记录; 页尾折叠体里是本次对比涉及的全部记录,每条都带证据级别、样本量与原始来源。