你这台机器,能跑到哪一档
选一台机器,我们按实测可用显存算给你看:装得下的最大模型是哪一个、这台机器上实测最快的配置是哪几个。 结论只来自别人的实测记录,每条都带着证据级别与原始来源。
填的应该是实际能用的量:驱动、桌面、其他进程吃掉的那部分不算在内。 不填就用型号的标称显存。
rtx_4080_super 目前能跑通的上限大约是 Qwen3-14B 14B 级别(Q4_K_M),显存峰值 11.2 GB,n=9。依据是装得下的记录里参数量最大的那一条。
产品建议再往上只能压更低比特的量化,那属于「跑得动但不好用」的区间,本地不一定划算。这不是测量结果,是我们基于工程经验的判断。
本机跑得最快的 Top 3
rtx_4080_super- Qwen/Qwen2.5-7B-Instruct-GGUFAWQ 4-bit L0 自报n=13 113.6tok/s
- meta-llama/Llama-3.1-8B-InstructAWQ 4-bit L0 自报n=7 113.6tok/s
- deepseek-ai/DeepSeek-R1-Distill-Qwen-14BQ4_K_M L0 自报n=6 60.8tok/s
排序只用我们真的测到的两件事:实测 decode 速度与证据级别。 模型能力不在本站的测量范围 —— 我们测的是"跑不跑得动、跑多快",不是"跑得好不好"。 同分时优先证据更硬的,其次是样本量更大的;同一组「模型 + 量化」只占一个名次。
这台机器的指标9 条 Run · 5 个模型 · 独立复现 1 · 待复现 8
这台机器的指标
全部实测记录9 条记录 · 含跑不通的
全部实测记录
含跑不通的microsoft/phi-4-GGUFQ5_K_M ollama 0.5.1Reddit最后入库 19 小时前n=11 43.3 1448 4863 — L0 自报 待复现 稳定
我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。
目前没有断言引用这条记录
「稳定」已被独立来源复现过,当前没有已知分歧。
复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。
Qwen3-14BQ4_K_M mlx-lm 0.18.2GitHub最后入库 19 小时前n=9 53.2 1802 4280 — L0 自报 待复现 稳定
我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。
目前没有断言引用这条记录
「稳定」已被独立来源复现过,当前没有已知分歧。
复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。
Qwen/Qwen2.5-7B-Instruct-GGUFAWQ 4-bit mlx-lm 0.18.2知乎最后入库 19 小时前n=13 113.6 3843 2421 — L0 自报 待复现 稳定
我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。
目前没有断言引用这条记录
「稳定」已被独立来源复现过,当前没有已知分歧。
复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。
Qwen3-14BQ6_K llama.cpp b6120站方自产最后入库 19 小时前n=7 39.5 1343 5592 — L0 自报 待复现 待复现
我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。
目前没有断言引用这条记录
「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。
复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。
Qwen3-14BQ6_K ollama 0.5.1GitHub最后入库 19 小时前n=15 36.7 1229 5592 — L1 已复现 待复现 稳定
我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。
目前没有断言引用这条记录
「稳定」已被独立来源复现过,当前没有已知分歧。
复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。
Qwen3-14BQ4_K_M ExLlamaV2 0.2.5知乎最后入库 19 小时前n=4 57.6 1986 4280 — L0 自报 待复现 待复现
我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。
目前没有断言引用这条记录
「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。
复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。
microsoft/phi-4-GGUFAWQ 4-bit llama.cpp b6120HuggingFace最后入库 19 小时前n=16 57.9 1970 4061 — L0 自报 待复现 稳定
我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。
目前没有断言引用这条记录
「稳定」已被独立来源复现过,当前没有已知分歧。
复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。
deepseek-ai/DeepSeek-R1-Distill-Qwen-14BQ4_K_M vLLM 0.6.2GitHub最后入库 19 小时前n=6 60.8 2127 4280 — L0 自报 待复现 待复现
我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。
目前没有断言引用这条记录
「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。
复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。
meta-llama/Llama-3.1-8B-InstructAWQ 4-bit vLLM 0.6.2Reddit最后入库 19 小时前n=7 113.6 3971 2655 — L0 自报 待复现 待复现
我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。
目前没有断言引用这条记录
「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。
复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。
跨硬件对照 · 同一模型4 张卡 × 7 个同款模型 · 只做数量级参考
跨硬件对照 · 同一模型
记录最多的前 4 张卡跨硬件不可比,只做数量级参考。不同厂商、不同后端、不同 batch size 的数字放在一张表里,能回答的是「这个模型在别的卡上是几倍」这种数量级问题,不是「谁更强」。
| 模型 | Apple M3 Max · 128G 统一内存 | unknown:rx-7900-gre | unknown:rtx-4080-super | unknown:apple-m2-ultra |
|---|---|---|---|---|
| deepseek-ai/DeepSeek-R1-Distill-Qwen-14B | 16.0tok/sn=13 | 42.2tok/sn=5 | 60.8tok/sn=6 | — |
| meta-llama/Llama-3.1-8B-Instruct | 43.4tok/sn=14 | 77.8tok/sn=51 | 113.6tok/sn=7 | — |
| microsoft/phi-4-GGUF | 33.4tok/sn=49 | 45.1tok/sn=9 | 57.9tok/sn=27 | — |
| mistralai/Mistral-Nemo-Instruct-2407 | — | 56.1tok/sn=10 | — | 73.0tok/sn=13 |
| Qwen/Qwen2.5-7B-Instruct-GGUF | 70.5tok/sn=13 | 96.1tok/sn=8 | 113.6tok/sn=13 | 109.8tok/sn=29 |
| Qwen3-14B14B | 15.5tok/sn=12 | 44.4tok/sn=15 | 57.6tok/sn=35 | 47.1tok/sn=28 |
| Qwen3-32B32B | 12.9tok/sn=30 | — | — | 25.8tok/sn=13 |
硬件分布10 个型号
硬件分布
72框架分布5 个框架
框架分布
72来源构成7 个来源
来源构成
72证据分级怎么读L0 51 · L1 15 · L2 6
证据分级怎么读
72- 绝大多数是 L0 自报。它们是一条条独立的帖子,我们只做了归一化,没有人验证过。
- L1 / L2 才是真的被别人跑过。级别由记录之间的相互验证推导,不由来源平台决定。
- 「跑不动」和「没有数据」是两回事。前者是有证据表明显存不够,后者是我们还没收录这个组合。
跑一样的东西一条可复制的命令 · 让你有机会升到 L1
跑一样的东西
想得到可比的数字,就用同一个模型与量化档。这样你的记录才有机会 成为别人的复现——也才有机会从 L0 升到 L1。
这一页怎么算的装得下怎么判 · 你填的显存管什么 · 没有数据不等于跑不动 · 上限只按参数量算
这一页怎么算的
- 「装得下」看的是实测显存峰值,不是标称显存。同样一张 24G 的卡,驱动、桌面和其他进程会吃掉一部分; 我们按记录里那一栏实测的峰值判断,所以你会看到 21.6 GB 这种数而不是 24 GB。上面那个框让你填的, 也正是实际能用的量。
- 你填的显存只影响「装不装得下」,不影响「跑不跑得动」。把可用显存填大,不会把一条跑不通的记录变成能跑 ——这两件事的证据来源不同:前者的来源是你,后者是别人的实测。
- 「没有数据」不等于「跑不动」。前者是我们还没收录这个配置,后者是有证据表明显存不够。 把前者读成后者,就是拿机器的沉默冒充人的结论。
- 上限只按参数量算。参数量没登记的模型不参与排序,页面会说明这一点——我们宁可说「算不出」, 也不按猜出来的大小给你一个看起来正常的错答案。