跑得动araoai.com
投稿
搜什么 常用 72 条 Run · 7 个模型 · 10 个硬件型号
能跑什么

你这台机器,能跑到哪一档

选一台机器,我们按实测可用显存算给你看:装得下的最大模型是哪一个、这台机器上实测最快的配置是哪几个。 结论只来自别人的实测记录,每条都带着证据级别与原始来源。

填的应该是实际能用的量:驱动、桌面、其他进程吃掉的那部分不算在内。 不填就用型号的标称显存。

先说结论 · 这台机器的上限

Apple M3 Max · 128G 统一内存 目前能跑通的上限大约是 Qwen3-32B 32B 级别(Q4_K_M),显存峰值 23.5 GB,n=15。依据是装得下的记录里参数量最大的那一条。

中位出词12.9区间8.7 – 70.5最快框架vLLM 0.6.2记录数5

产品建议再往上只能压更低比特的量化,那属于「跑得动但不好用」的区间,本地不一定划算。这不是测量结果,是我们基于工程经验的判断。

本机跑得最快的 Top 3

Apple M3 Max · 128G 统一内存
  1. Qwen/Qwen2.5-7B-Instruct-GGUFAWQ 4-bit L2 跨框架已验证n=7 70.5tok/s
  2. Qwen/Qwen2.5-7B-Instruct-GGUFQ5_K_M L0 自报n=6 47.1tok/s
  3. meta-llama/Llama-3.1-8B-InstructQ5_K_M L0 自报n=9 43.4tok/s

排序只用我们真的测到的两件事:实测 decode 速度证据级别模型能力不在本站的测量范围 —— 我们测的是"跑不跑得动、跑多快",不是"跑得好不好"。 同分时优先证据更硬的,其次是样本量更大的;同一组「模型 + 量化」只占一个名次。

重置
证据 全部L1 及以上L2 跨框架 命中 5
这台机器的指标13 条 Run · 6 个模型 · 独立复现 5 · 待复现 8

这台机器的指标

该型号 Run
13
已验证模型
6
去重后的模型数
最快实测
70.5 tok/s
Qwen/Qwen2.5-7B-Instruct-GGUF · AWQ 4-bit · n=7
实测可用显存
128 GB
型号标称值
独立复现
5
L1 及以上
待复现
8
仍只有自报
框架覆盖
5
llamacpp ×4
数据许可
CC BY 4.0
允许转载,署名即可
全部实测记录5 条记录 · 含跑不通的

全部实测记录

含跑不通的
模型 / 量化 decodetok/s prefilltok/s TTFTms 显存峰值GB 证据 复现链 状态
meta-llama/Llama-3.1-8B-InstructQ8_0 vLLM 0.6.2HuggingFace最后入库 20 小时前n=5 32.7 1142 4322 L1 已复现 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB11.3
显存总量
样本量5
复现次数0
硬件Apple M3 Max · 128G 统一内存
模型meta-llama/Llama-3.1-8B-Instruct
量化Q8_0
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名79b2a51fcd3d178d1ee5d2070e329d3c7d87f872c24c0e50788a3e6c9881e436
复现链
窄屏隐藏的列
框架vLLM 0.6.2
prefill tok/s1142
TTFT 冷启 ms4322
decode tok/s32.7
归一化未命中model: meta-llama/Llama-3.1-8B-Instruct
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台HuggingFace
抓取时间20 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen/Qwen2.5-7B-Instruct-GGUFAWQ 4-bit vLLM 0.6.2知乎最后入库 20 小时前n=7 70.5 2466 2421 L2 跨框架已验证 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB6.1
显存总量
样本量7
复现次数0
硬件Apple M3 Max · 128G 统一内存
模型Qwen/Qwen2.5-7B-Instruct-GGUF
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L2 跨框架已验证
测量方站方自产
配置签名1a7de696fb9be50cf2e6941e9361aaf080c9732e74b19a0278b6153b0e7e76e2
复现链
窄屏隐藏的列
框架vLLM 0.6.2
prefill tok/s2466
TTFT 冷启 ms2421
decode tok/s70.5
归一化未命中model: Qwen/Qwen2.5-7B-Instruct-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台知乎
抓取时间20 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen3-32BQ4_K_M llama.cpp b6120B站最后入库 20 小时前n=15 12.9 439 8780 L1 已复现 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB23.5
显存总量
样本量15
复现次数0
硬件Apple M3 Max · 128G 统一内存
模型Qwen3-32B
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名a648db8efc305f6c447e86acdd56df39f2ec03c7d15fd2fa39a4c5abbe64c14a
复现链
窄屏隐藏的列
框架llama.cpp b6120
prefill tok/s439
TTFT 冷启 ms8780
decode tok/s12.9
归一化未命中
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台B站
抓取时间20 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

deepseek-ai/DeepSeek-R1-Distill-Qwen-14BFP16 mlx-lm 0.18.2HuggingFace最后入库 20 小时前n=10 8.7 294 12447 L1 已复现 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB33.5
显存总量
样本量10
复现次数0
硬件Apple M3 Max · 128G 统一内存
模型deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
量化FP16
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名89de7107f9cc4bb67c7fbf5fa95b917e19fc07e78f4b6b1949c54e3d26053de9
复现链
窄屏隐藏的列
框架mlx-lm 0.18.2
prefill tok/s294
TTFT 冷启 ms12447
decode tok/s8.7
归一化未命中model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台HuggingFace
抓取时间20 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen3-32BQ5_K_M llama.cpp b5980HuggingFace最后入库 20 小时前n=15 10.6 358 10113 L1 已复现 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB27.1
显存总量
样本量15
复现次数0
硬件Apple M3 Max · 128G 统一内存
模型Qwen3-32B
量化Q5_K_M
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名145c3e1ae16df854078eeeb1eef9b690eb3299095866fc0d69c4cd33a5951f90
复现链
窄屏隐藏的列
框架llama.cpp b5980
prefill tok/s358
TTFT 冷启 ms10113
decode tok/s10.6
归一化未命中
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台HuggingFace
抓取时间20 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

跨硬件对照 · 同一模型4 张卡 × 7 个同款模型 · 只做数量级参考

跨硬件对照 · 同一模型

记录最多的前 4 张卡

跨硬件不可比,只做数量级参考。不同厂商、不同后端、不同 batch size 的数字放在一张表里,能回答的是「这个模型在别的卡上是几倍」这种数量级问题,不是「谁更强」。

同一模型在不同硬件上的最快实测(不区分量化档)
模型Apple M3 Max · 128G 统一内存unknown:rx-7900-greunknown:rtx-4080-superunknown:apple-m2-ultra
deepseek-ai/DeepSeek-R1-Distill-Qwen-14B16.0tok/sn=1342.2tok/sn=560.8tok/sn=6
meta-llama/Llama-3.1-8B-Instruct43.4tok/sn=1477.8tok/sn=51113.6tok/sn=7
microsoft/phi-4-GGUF33.4tok/sn=4945.1tok/sn=957.9tok/sn=27
mistralai/Mistral-Nemo-Instruct-240756.1tok/sn=1073.0tok/sn=13
Qwen/Qwen2.5-7B-Instruct-GGUF70.5tok/sn=1396.1tok/sn=8113.6tok/sn=13109.8tok/sn=29
Qwen3-14B14B15.5tok/sn=1244.4tok/sn=1557.6tok/sn=3547.1tok/sn=28
Qwen3-32B32B12.9tok/sn=3025.8tok/sn=13
硬件分布10 个型号

硬件分布

72
Apple M3 Max · 128G 统一内存13
rx_7900_gre11
rtx_4080_super9
apple_m2_ultra8
NVIDIA RTX 3090 · 24G7
arc_a7706
rtx_30606
rx_7800_xt5
NVIDIA RTX 4090 · 24G4
AMD Radeon RX 7900 XTX · 24G3
框架分布5 个框架

框架分布

72
llama.cpp18
mlx-lm18
ExLlamaV216
ollama10
vLLM10
来源构成7 个来源

来源构成

72
HuggingFace11
Reddit11
B站10
GitHub10
V2EX10
知乎10
站方自产10
证据分级怎么读L0 51 · L1 15 · L2 6

证据分级怎么读

72
L051
L115
L26
  • 绝大多数是 L0 自报。它们是一条条独立的帖子,我们只做了归一化,没有人验证过。
  • L1 / L2 才是真的被别人跑过。级别由记录之间的相互验证推导,不由来源平台决定。
  • 「跑不动」和「没有数据」是两回事。前者是有证据表明显存不够,后者是我们还没收录这个组合。
跑一样的东西一条可复制的命令 · 让你有机会升到 L1

跑一样的东西

想得到可比的数字,就用同一个模型与量化档。这样你的记录才有机会 成为别人的复现——也才有机会从 L0 升到 L1。

repro run qwen3-32b --hardware "Apple M3 Max · 128G 统一内存"
这一页怎么算的装得下怎么判 · 你填的显存管什么 · 没有数据不等于跑不动 · 上限只按参数量算

这一页怎么算的

  • 「装得下」看的是实测显存峰值,不是标称显存。同样一张 24G 的卡,驱动、桌面和其他进程会吃掉一部分; 我们按记录里那一栏实测的峰值判断,所以你会看到 21.6 GB 这种数而不是 24 GB。上面那个框让你填的, 也正是实际能用的量。
  • 你填的显存只影响「装不装得下」,不影响「跑不跑得动」。把可用显存填大,不会把一条跑不通的记录变成能跑 ——这两件事的证据来源不同:前者的来源是你,后者是别人的实测。
  • 「没有数据」不等于「跑不动」。前者是我们还没收录这个配置,后者是有证据表明显存不够。 把前者读成后者,就是拿机器的沉默冒充人的结论。
  • 上限只按参数量算。参数量没登记的模型不参与排序,页面会说明这一点——我们宁可说「算不出」, 也不按猜出来的大小给你一个看起来正常的错答案。
数据 CC BY 4.0 · 可被 AI 引用 复现 ≠ 点赞 来源:GitHub · Reddit · HuggingFace · 站方自产 方法与边界 投稿指南 API RSS