跑得动araoai.com
投稿
搜什么 常用 M3 Max × Qwen3-32BRX 7900 GRE · 未归一化 × Llama-3.1-8B-Instruct · 未归一化Qwen2.5-7B-Instruct · 未归一化 × mlx-lmQ4_K_M 72 条 Run · 7 个模型 · 10 个硬件型号
按硬件看

库里有记录的,每一张卡

这一页是"取值"的入口,不是天梯。表按记录条数降序——那是我们有多少观测, 不是谁更快。显存够不够跑某个模型,去能不能跑问;想看记录本身,去 Benchmark

全部硬件

10 个取值 · 72 条记录

这是库里有记录的全部硬件。点一个进去,就是它自己的页面:在这张卡上跑过的模型、各自的证据级别,以及我们没有收录的组合。

库里的全部硬件:各自的实测 decode 中位(按记录条数降序)
硬件 decode 中位 区间 记录数 证据
Apple M3 Max · 128G 统一内存 28.9tok/sn=1238.7 – 70.5tok/s 11占 15% L1 已复现
RX 7900 GRE · 未归一化 46.4tok/sn=8841.2 – 96.1tok/s 10占 14% L1 已复现
M2 Ultra · 未归一化 40.9tok/sn=8017.7 – 109.8tok/s 8占 11% L1 已复现
NVIDIA RTX 3090 · 24G 73.2tok/sn=7448.2 – 109.8tok/s 7占 10% L0 自报
RTX 3060 · 未归一化 29.8tok/sn=5125.5 – 55.6tok/s 7占 10% L2 跨框架已验证
RTX 4080 SUPER · 未归一化 57.9tok/sn=6639.5 – 113.6tok/s 7占 10% L0 自报
Arc A770 · 未归一化 57.5tok/sn=6033.7 – 87.6tok/s 6占 8% L1 已复现
NVIDIA RTX 4090 · 24G 77.6tok/sn=5662.5 – 155.5tok/s 6占 8% L2 跨框架已验证
RX 7800 XT · 未归一化 49.5tok/sn=6844.6 – 85.4tok/s 6占 8% L2 跨框架已验证
AMD Radeon RX 7900 XTX · 24G 107.0tok/sn=4837.2 – 169.3tok/s 4占 6% L0 自报
数据 CC BY 4.0 · 可被 AI 引用 复现 ≠ 点赞 来源:GitHub · Reddit · HuggingFace · Arao 自产 方法与边界 投稿指南 API RSS