该型号 Run
5
选一台机器,我们按实测可用显存算给你看:装得下的最大模型是哪一个、这台机器上实测最快的配置是哪几个。 结论只来自别人的实测记录,每条都带着证据级别与原始来源。
填的应该是实际能用的量:驱动、桌面、其他进程吃掉的那部分不算在内。 不填就用型号的标称显存。
我们还没有 rx_7800_xt 的实测记录。没有数据不等于跑不动——是我们还没有收录,不是这台机器不行。
把你的数字提交上来 —— 下一个人搜这台机器时就能看到。
排序只用我们真的测到的两件事:实测 decode 速度与证据级别。 模型能力不在本站的测量范围 —— 我们测的是"跑不跑得动、跑多快",不是"跑得好不好"。 同分时优先证据更硬的,其次是样本量更大的;同一组「模型 + 量化」只占一个名次。
跨硬件不可比,只做数量级参考。不同厂商、不同后端、不同 batch size 的数字放在一张表里,能回答的是「这个模型在别的卡上是几倍」这种数量级问题,不是「谁更强」。
| 模型 | Apple M3 Max · 128G 统一内存 | unknown:rx-7900-gre | unknown:rtx-4080-super | unknown:apple-m2-ultra |
|---|---|---|---|---|
| deepseek-ai/DeepSeek-R1-Distill-Qwen-14B | 16.0tok/sn=13 | 42.2tok/sn=5 | 60.8tok/sn=6 | — |
| meta-llama/Llama-3.1-8B-Instruct | 43.4tok/sn=14 | 77.8tok/sn=51 | 113.6tok/sn=7 | — |
| microsoft/phi-4-GGUF | 33.4tok/sn=49 | 45.1tok/sn=9 | 57.9tok/sn=27 | — |
| mistralai/Mistral-Nemo-Instruct-2407 | — | 56.1tok/sn=10 | — | 73.0tok/sn=13 |
| Qwen/Qwen2.5-7B-Instruct-GGUF | 70.5tok/sn=13 | 96.1tok/sn=8 | 113.6tok/sn=13 | 109.8tok/sn=29 |
| Qwen3-14B14B | 15.5tok/sn=12 | 44.4tok/sn=15 | 57.6tok/sn=35 | 47.1tok/sn=28 |
| Qwen3-32B32B | 12.9tok/sn=30 | — | — | 25.8tok/sn=13 |
想得到可比的数字,就用同一个模型与量化档。这样你的记录才有机会 成为别人的复现——也才有机会从 L0 升到 L1。