跑得动araoai.com
投稿
搜什么 常用 M3 Max × Qwen3-32BRX 7900 GRE · 未归一化 × Llama-3.1-8B-Instruct · 未归一化Qwen2.5-7B-Instruct · 未归一化 × mlx-lmQ4_K_M 72 条 Run · 7 个模型 · 10 个硬件型号
按模型看

库里有记录的,每一个模型

这一页是"取值"的入口,不是排行榜。表按记录条数降序——那是我们有多少观测, 不是谁更强。每一行的中位都带样本量;没有有效样本量的行不显示数字。 想把几个模型摆在一张表上比,用横向对比;想看记录本身,去 Benchmark

全部模型

7 个取值 · 72 条记录

这是库里有记录的全部模型。点一个进去,就是它自己的页面:跨硬件对照、量化档分布,以及我们没有收录的组合。

库里的全部模型:各自的实测 decode 中位(按记录条数降序)
模型 decode 中位 区间 记录数 证据
Qwen2.5-7B-Instruct · 未归一化 89.3tok/sn=15534.7 – 169.3tok/s 16占 22% L0 自报
Llama-3.1-8B-Instruct · 未归一化 69.9tok/sn=12632.7 – 113.6tok/s 12占 17% L2 跨框架已验证
phi-4 · 未归一化 47.2tok/sn=13428.9 – 75.1tok/s 11占 15% L0 自报
Qwen3-14B14B 41.7tok/sn=9215.5 – 67.7tok/s 11占 15% L1 已复现
Mistral-Nemo-Instruct-2407 · 未归一化 64.5tok/sn=9525.5 – 86.1tok/s 10占 14% L2 跨框架已验证
DeepSeek-R1-Distill-Qwen-14B · 未归一化 39.7tok/sn=748.7 – 66.3tok/s 9占 13% L1 已复现
Qwen3-32B32B 12.9tok/sn=3810.6 – 25.8tok/s 3占 4% L0 自报
数据 CC BY 4.0 · 可被 AI 引用 复现 ≠ 点赞 来源:GitHub · Reddit · HuggingFace · Arao 自产 方法与边界 投稿指南 API RSS