跑得动araoai.com
投稿
搜什么 常用 M3 Max × Qwen3-32BRX 7900 GRE · 未归一化 × Llama-3.1-8B-Instruct · 未归一化Qwen2.5-7B-Instruct · 未归一化 × mlx-lmQ4_K_M 72 条 Run · 7 个模型 · 10 个硬件型号
横向对比

把几个配置,摆在一张表上

两种问法:同一个模型在哪张卡上更快,和同一台机器上哪个框架更快。 表里每一列是一个对比项,每一行是一个指标,数字是中位数,后面跟着支撑它的样本量。 结论只对我们库里这些记录成立——跨硬件不可比,这里做的是数量级参考,不是横评。

先选比什么

最多 6 个对比项

两种模式问的是两件不同的事:同一个模型在哪张卡上更快, 和同一台机器上哪个后端更快。换模式等于换一个问题,基准与对比项都不沿用。

先说结论

这些记录不足以支撑一个排序结论:这次对比里没有任何一个对比项有可用的 decode 中位数——每个数字都需要有效的样本量(n>0)。

同一台机器上不同框架的默认参数、batch size 与版本都可能不同——这里比的是记录,不是框架本身。

能不能放在一起看

逐项核对 6 项 · 另有 1 项是你选来对比的

判据是这 7 项:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数;你选来对比的那一维(框架(含版本))本来就不一样,所以不计入差异数。门槛(写在这里,你可以自己核对):0 维不同 → 可直接比较;1–2 维不同 → 方向性可比;≥3 维不同 → 不可比。「未核对」不是「一致」:只有一侧有值、或某一列的记录没全登记,一律不给绿灯;双方都没有值的维度会单独点名,也不算一致。门槛要求至少 1 项确认一致,所以"什么都不知道"也不会是绿灯。

🟡 方向性可比

逐项看下来没有确认不同的维度,但 模型量化上下文长度硬件batch并发数 没有任何记录参与中位数 —— 缺值不是一致,所以这里不给绿灯。

这是两道独立的闸:上面那一道问「能不能排序」(样本量与证据级别够不够), 这一道问「能不能放在一起看」(条件是否一致)。两个都过,这几个数字才谈得上可比。

逐项核对
模型未核对 有对比项没有任何记录参与中位数 —— 无从核对,不是一致
量化未核对 有对比项没有任何记录参与中位数 —— 无从核对,不是一致
框架(含版本)未核对 有对比项没有任何记录参与中位数 —— 无从核对,不是一致(这一维是你选的对比维度)
上下文长度未核对 有对比项没有任何记录参与中位数 —— 无从核对,不是一致
硬件未核对 有对比项没有任何记录参与中位数 —— 无从核对,不是一致
batch未核对 有对比项没有任何记录参与中位数 —— 无从核对,不是一致
并发数未核对 有对比项没有任何记录参与中位数 —— 无从核对,不是一致
对比项(框架)· 最多 6 个

点一下加入对比,再点一下移出。括号里的数字是点下去会得到几条记录 (所以 0 意味着这个组合我们还没收录,不是它跑不了)。

横向对比 · 同一硬件 × 多框架

基准:Arc A770 · 未归一化 · 1 个对比项

四个指标都取中位数,而且只统计有有效样本量的记录 (没有 n 的记录在任何一格都不参与)。decode 与 prefill 越高越快,TTFT 与显存峰值越低越好。 每一格后面的小字是支撑这个数字的样本量;最下面两行是整列的证据级别与样本量合计。 排序结论只对「我们库里这些记录」成立,不构成对硬件或框架能力的判断。

同一台机器(Arc A770 · 未归一化)上不同框架的 decode 中位数
指标ollama · 0 条记录
decode越高越好
prefill越高越好
TTFT 冷启越低越好
显存峰值越低越好
证据
n整列样本量合计
这一页怎么比的为什么用中位数 · 排序为什么要两道闸 · 为什么不给排序下强结论 · 上限是多少

这一页怎么比的

  • 四个指标都取中位数,而且只统计有有效样本量的记录。中位数对个别离群值不敏感; 没有样本量的记录在任何一格都不参与——一个没有 n 的统计值和编出来的数字没有区别。 每一格后面的小字就是支撑它的样本量。
  • 排序只看 decode 中位数,而且有两道闸。要给出「谁的 decode 中位数最高」这句话, 最高那一项必须至少 n≥3、证据级别至少 L1。单次观测排不出高低, 自报数字排出来的顺序也不构成可比性。任何一条不满足,这一页就直接说 「这些记录不足以支撑一个排序结论」——不硬指定谁更高
  • 这里不给排序下强结论。跨硬件不可比,只做数量级参考:不同厂商、不同后端、 不同 batch size 的数字放在一张表里,能回答的是「差几倍」,不是「谁更强」。 买哪张卡、用哪个框架,还要看你的预算、你的模型和你的耐心——那些都不在这张表里。
  • 对比项有数量上限。超过上限的网址会被拒绝(返回 400 页并说明超了几个), 而不是悄悄丢掉多余的项——那种"看起来筛了、其实没筛"的失败最难发现。 上限写在页面上方的模式切换那一块里,数字取自代码里的同一个常量。
  • 每个对比项都能点进去。列头是链接,指向数据页里筛好的那份记录; 页尾折叠体里是本次对比涉及的全部记录,每条都带证据级别、样本量与原始来源。
数据 CC BY 4.0 · 可被 AI 引用 复现 ≠ 点赞 来源:GitHub · Reddit · HuggingFace · Arao 自产 方法与边界 投稿指南 API RSS