Qwen3-32B
L0 自报Q4_K_M · llama.cpp b4567
- NVIDIA RTX 4090
- 24GB
- Ubuntu 24.04
- CUDA 12.4
18tok/s
Decode
210.5tok/s
Prefill
19.5GB
VRAM
- NVIDIA
- llama.cpp
- 个人自报
基于真实运行数据,查询你硬件能跑的模型、框架、量化组合。
不只是速度,更告诉你:这条数据有多可靠,能不能直接比较,证据从哪里来。
基于真实采集的数据,展示最新的模型运行结果。
Q4_K_M · llama.cpp b4567
18tok/s
Decode
210.5tok/s
Prefill
19.5GB
VRAM
Q4_K_M · llama.cpp b4602
18.6tok/s
Decode
218tok/s
Prefill
19.4GB
VRAM
Q4_K_M · llama.cpp b4602
18.6tok/s
Decode
222.3tok/s
Prefill
19.6GB
VRAM
Q4_K_M · Ollama 0.5.7
17.4tok/s
Decode
198.2tok/s
Prefill
19.8GB
VRAM
我们用结构化的证据体系,告诉你每条数据的可信度。
来自社区或个人发布,未经过独立验证。
社区复现,小规模独立验证,含复现次数。
同硬件 + 同模型,同量化下的多框架实测数据。