按模型看
库里有记录的,每一个模型
这一页是"取值"的入口,不是排行榜。表按记录条数降序——那是我们有多少观测, 不是谁更强。每一行的中位都带样本量;没有有效样本量的行不显示数字。 想把几个模型摆在一张表上比,用横向对比;想看记录本身,去 Benchmark。
全部模型
7 个取值 · 72 条记录这是库里有记录的全部模型。点一个进去,就是它自己的页面:跨硬件对照、量化档分布,以及我们没有收录的组合。
| 模型 | decode 中位 | 区间 | 记录数 | 证据 |
|---|---|---|---|---|
| Qwen2.5-7B-Instruct · 未归一化 | 89.3tok/sn=155 | 34.7 – 169.3tok/s | 16条占 22% | L0 自报 |
| Llama-3.1-8B-Instruct · 未归一化 | 69.9tok/sn=126 | 32.7 – 113.6tok/s | 12条占 17% | L2 跨框架已验证 |
| phi-4 · 未归一化 | 47.2tok/sn=134 | 28.9 – 75.1tok/s | 11条占 15% | L0 自报 |
| Qwen3-14B14B | 41.7tok/sn=92 | 15.5 – 67.7tok/s | 11条占 15% | L1 已复现 |
| Mistral-Nemo-Instruct-2407 · 未归一化 | 64.5tok/sn=95 | 25.5 – 86.1tok/s | 10条占 14% | L2 跨框架已验证 |
| DeepSeek-R1-Distill-Qwen-14B · 未归一化 | 39.7tok/sn=74 | 8.7 – 66.3tok/s | 9条占 13% | L1 已复现 |
| Qwen3-32B32B | 12.9tok/sn=38 | 10.6 – 25.8tok/s | 3条占 4% | L0 自报 |