Qwen3-32B · NVIDIA RTX 4090
llama.cpp · Q4_K_M · 由 3 条实测记录聚合(2 个来源类型)
实测指标
- Decode
- 18.4tok/s
- Prefill
- 216.93tok/s
- TTFT
- 1.19s
- 显存占用
- 19.5GB
- TTFB *
- —
- MTP 接受率
- —
- 功耗
- 347.17W
数字是「llama.cpp · Q4_K_M」这个组合下 全部已上架记录的均值。
TTFB 的单位尚待确认(原型标注为 GB,按录入原值展示)。
运行事实
- 实测显存占用
- 19.5 GB
- NVIDIA RTX 4090 标称显存
- 24 GB
本站只收录实测数据。能不能在你的机器上跑起来,请对照你的显存、量化大小与上下文长度自行判断—— 我们没有你的硬件信息。
基本配置
这些字段逐条记录各不相同,因此只在全部记录取值相同时才在这里给出值。
硬件与模型
- 硬件
- NVIDIA RTX 4090独立显卡
- 标称显存
- 24 GB
- 模型
- Qwen3-32B
- 参数规模
- 32 B
比的是「同一个模型 + 同一款硬件」下的不同框架与量化。点上面的按钮切换指标。
- llama.cpp · Q4_K_M 当前216.93 tok/s
- Ollama · Q4_K_M 198.2 tok/s
实测明细(3 条)
这一行的均值由下列记录算出。每一行是一次独立的实测,带各自的配置、证据等级与来源。
| # | 框架版本 | 操作系统 | 驱动 / CUDA | 上下文 | 批大小 | GPU 层 | Flash Attn | Decode | Prefill | 显存 | TTFT | TTFB | MTP | 功耗 | 证据等级 | 来源 | 最后验证 | 更新时间 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | b4567 | Ubuntu 24.04 | 550.107.02 / 12.4 | 8192 | 512 | 99 | 开启 | 18 | 210.5 | 19.5 | 1.24 | — | — | 342.5 | L0 自报 | GitHub | 2026-08-12 | 2026-09-18 |
| 2 | b4602 | Ubuntu 24.04 | 550.107.02 / 12.4 | 8192 | 未填 | 99 | 开启 | 18.6 | 218 | 19.4 | 1.18 | — | — | 348 | L1 已复现 | GitHub | 2026-08-20 | 2026-09-18 |
| 3 | b4602 | Windows 11 24H2 | 552.22 / 12.4 | 16384 | 未填 | 99 | 开启 | 18.6 | 222.3 | 19.6 | 1.15 | — | — | 351 | L2 跨框架验证 | 2026-09-01 | 2026-09-18 |
表格可横向滚动查看更多列。
来源原文
#1 GitHub · https://github.com/ggml-org/llama.cpp/discussions/1
Q4_K_M, 8192 ctx, single 4090: ~18 tok/s decode.
#2 GitHub · https://github.com/ggml-org/llama.cpp/discussions/2
复现成功,decode 18.6 tok/s,与本机一致。
#3 Reddit · https://www.reddit.com/r/LocalLLaMA/comments/araoai_qwen3_32b
llama.cpp 与 Ollama 两条路径均复现,18-19 tok/s。