模型
Qwen2.5-7B-Instruct · 未归一化在我们记录里的实测
关于这个模型,我们收录了 16 条记录。 这一页把它们摊开:中位吞吐与区间、每一行的样本量与证据级别,以及我们没有收录的组合 ——缺的那些我们不会替你补一个数字。
先说结论 · 这个模型在我们记录里的样子
在当前记录里,Qwen2.5-7B-Instruct · 未归一化 的解码吞吐中位数是 89.3 tok/s (34.7 – 169.3,n=155,共 16 条记录), 最高证据级别是 L0 自报。
在这些硬件里,NVIDIA RTX 4090 · 24G 的中位数最高(中位 155.5 tok/s, n=17,证据 L0)。 这是表里数字的高低,不是我们在替你选——样本量、量化档、框架都不同,能核对的都在表里。
跨硬件对照 · 这个模型
10 个硬件型号 · 16 条记录跨硬件不可比,只做数量级参考。不同厂商、不同后端、不同 batch size 的数字放在一张表里,能回答的是「这个模型在别的卡上是几倍」这种数量级问题,不是「谁更强」。
行按记录条数降序排列——条数是「我们有多少条观测」,不是「谁更强」:不同硬件之间的量化档、框架、上下文长度都不一样。每一行的 n= 是那一格参与统计的样本量之和;没有有效样本量的格子不渲染数字,渲染 ———— 是"我们不知道",不是 0。
| 硬件 | decode 中位 | 区间 | 记录数 | 证据 |
|---|---|---|---|---|
| M2 Ultra · 未归一化 | 91.0tok/sn=32 | 34.7 – 109.8tok/s | 3条占 19% | L0 自报 |
| AMD Radeon RX 7900 XTX · 24G | 154.1tok/sn=21 | 138.9 – 169.3tok/s | 2条占 13% | L0 自报 |
| Apple M3 Max · 128G 统一内存 | 58.8tok/sn=15 | 47.1 – 70.5tok/s | 2条占 13% | L0 自报 |
| NVIDIA RTX 3090 · 24G | 85.8tok/sn=17 | 78.0 – 93.5tok/s | 2条占 13% | L0 自报 |
| RTX 3060 · 未归一化 | 50.1tok/sn=16 | 44.6 – 55.6tok/s | 2条占 13% | L0 自报 |
| Arc A770 · 未归一化 | 87.6tok/sn=15 | 87.6 – 87.6tok/s | 1条占 6% | L0 自报 |
| NVIDIA RTX 4090 · 24G | 155.5tok/sn=17 | 155.5 – 155.5tok/s | 1条占 6% | L0 自报 |
| RTX 4080 SUPER · 未归一化 | 113.6tok/sn=14 | 113.6 – 113.6tok/s | 1条占 6% | L0 自报 |
| RX 7800 XT · 未归一化 | 51.0tok/sn=3 | 51.0 – 51.0tok/s | 1条占 6% | L0 自报 |
| RX 7900 GRE · 未归一化 | 96.1tok/sn=5 | 96.1 – 96.1tok/s | 1条占 6% | L0 自报 |
量化档分布
6 个量化档 · 16 条记录分母是这个名字下我们收录的 16 条记录;「占」那一列就是分布。只列有记录的量化档——没有记录的组合不在这里, 我们不会替它编一个 0。
| 量化档 | decode 中位 | 区间 | 记录数 | 证据 |
|---|---|---|---|---|
| AWQ 4-bit | 104.8tok/sn=58 | 55.6 – 169.3tok/s | 6条占 38% | L0 自报 |
| Q4_K_M | 109.8tok/sn=38 | 87.6 – 138.9tok/s | 3条占 19% | L0 自报 |
| Q5_K_M | 45.9tok/sn=13 | 44.6 – 47.1tok/s | 2条占 13% | L0 自报 |
| Q6_K | 92.3tok/sn=18 | 91.0 – 93.5tok/s | 2条占 13% | L0 自报 |
| Q8_0 | 64.5tok/sn=17 | 51.0 – 78.0tok/s | 2条占 13% | L0 自报 |
| FP16 | 34.7tok/sn=11 | 34.7 – 34.7tok/s | 1条占 6% | L0 自报 |
接着看
这个模型在站内的其他入口这一页怎么算的
三件我们不做的事-
只列有记录的组合。某个硬件上这个模型一条记录都没有时,表里没有这一行,
我们只会在表下把它点名——而不会渲染一个
0或者一格占位数字。 「没有数据」与「跑不动」是两回事:前者是我们还没收录,后者是有证据表明显存不够。 把前者读成后者,就是拿记录的沉默冒充站方的结论。 -
没有样本量就不给数字。一行的中位与区间只有在那一格有有效
n时才渲染, 否则渲染—。一个不知道是几次跑出来的速度,不能拿来选型———在这里是"我们不知道",不是 0。 - 不给"该跑哪个"这类排序。表按记录条数降序(那是"我们有多少观测"), 「中位数最高」那种句子是可核对的陈述,逐行都能查证。 记录里没有能力、价格、功耗字段,所以"哪个更好"这种问题我们不答—— 答了就是编。