跑得动araoai.com
投稿
搜什么 常用 M3 Max × Qwen3-32BRX 7900 GRE · 未归一化 × Llama-3.1-8B-Instruct · 未归一化Qwen2.5-7B-Instruct · 未归一化 × mlx-lmQ4_K_M 72 条 Run · 7 个模型 · 10 个硬件型号
模型

phi-4 · 未归一化在我们记录里的实测

关于这个模型,我们收录了 11 条记录。 这一页把它们摊开:中位吞吐与区间、每一行的样本量与证据级别,以及我们没有收录的组合 ——缺的那些我们不会替你补一个数字。

先说结论 · 这个模型在我们记录里的样子

在当前记录里,phi-4 · 未归一化 的解码吞吐中位数是 47.2 tok/s (28.9 – 75.1,n=134,共 11 条记录), 最高证据级别是 L0 自报

中位出词47.2 tok/s区间28.9 – 75.1样本量n=134记录数11参数量最高证据L0 自报

在这些硬件里,NVIDIA RTX 3090 · 24G 的中位数最高(中位 60.7 tok/s, n=26,证据 L0)。 这是表里数字的高低,不是我们在替你选——样本量、量化档、框架都不同,能核对的都在表里。

跨硬件对照 · 这个模型

7 个硬件型号 · 11 条记录

跨硬件不可比,只做数量级参考。不同厂商、不同后端、不同 batch size 的数字放在一张表里,能回答的是「这个模型在别的卡上是几倍」这种数量级问题,不是「谁更强」。

行按记录条数降序排列——条数是「我们有多少条观测」,不是「谁更强」:不同硬件之间的量化档、框架、上下文长度都不一样。每一行的 n= 是那一格参与统计的样本量之和;没有有效样本量的格子不渲染数字,渲染 —— 是"我们不知道",不是 0。

同一个模型在不同硬件上的实测中位(按记录条数降序)
硬件 decode 中位 区间 记录数 证据
AMD Radeon RX 7900 XTX · 24G 56.1tok/sn=2737.2 – 75.1tok/s 2占 18% L0 自报
Apple M3 Max · 128G 统一内存 29.5tok/sn=2928.9 – 30.2tok/s 2占 18% L0 自报
NVIDIA RTX 3090 · 24G 60.7tok/sn=2648.2 – 73.2tok/s 2占 18% L0 自报
RTX 4080 SUPER · 未归一化 50.6tok/sn=2643.3 – 57.9tok/s 2占 18% L0 自报
Arc A770 · 未归一化 49.4tok/sn=849.4 – 49.4tok/s 1占 9% L0 自报
RX 7800 XT · 未归一化 47.2tok/sn=847.2 – 47.2tok/s 1占 9% L0 自报
RX 7900 GRE · 未归一化 45.1tok/sn=1045.1 – 45.1tok/s 1占 9% L0 自报

表里没有 M2 Ultra · 未归一化NVIDIA RTX 4090 · 24GRTX 3060 · 未归一化我们还没收录这个组合「没有数据」不等于「跑不动」——前者是我们还没收录,后者是有证据表明显存不够。 把前者读成后者,就是拿记录的沉默冒充站方的结论。这不是硬件的问题,是我们的缺口。

量化档分布

5 个量化档 · 11 条记录

分母是这个名字下我们收录的 11 条记录;「占」那一列就是分布。只列有记录的量化档——没有记录的组合不在这里, 我们不会替它编一个 0。

同一个模型在各量化档上的实测中位(按记录条数降序)
量化档 decode 中位 区间 记录数 证据
AWQ 4-bit 48.3tok/sn=4330.2 – 57.9tok/s 4占 36% L0 自报
Q4_K_M 59.2tok/sn=5328.9 – 75.1tok/s 4占 36% L0 自报
Q5_K_M 43.3tok/sn=1243.3 – 43.3tok/s 1占 9% L0 自报
Q6_K 48.2tok/sn=1148.2 – 48.2tok/s 1占 9% L0 自报
Q8_0 37.2tok/sn=1537.2 – 37.2tok/s 1占 9% L0 自报

这一页怎么算的

三件我们不做的事
  • 只列有记录的组合。某个硬件上这个模型一条记录都没有时,表里没有这一行, 我们只会在表下把它点名——而不会渲染一个 0 或者一格占位数字。 「没有数据」与「跑不动」是两回事:前者是我们还没收录,后者是有证据表明显存不够。 把前者读成后者,就是拿记录的沉默冒充站方的结论。
  • 没有样本量就不给数字。一行的中位与区间只有在那一格有有效 n 时才渲染, 否则渲染 。一个不知道是几次跑出来的速度,不能拿来选型—— 在这里是"我们不知道",不是 0。
  • 不给"该跑哪个"这类排序。表按记录条数降序(那是"我们有多少观测"), 「中位数最高」那种句子是可核对的陈述,逐行都能查证。 记录里没有能力、价格、功耗字段,所以"哪个更好"这种问题我们不答—— 答了就是编。
数据 CC BY 4.0 · 可被 AI 引用 复现 ≠ 点赞 来源:GitHub · Reddit · HuggingFace · Arao 自产 方法与边界 投稿指南 API RSS