Arao AI本地 AI 部署实测数据库

Qwen3-32B · NVIDIA RTX 4090

llama.cpp · Q4_K_M · 由 3 条实测记录聚合(2 个来源类型)

实测指标

Decode
18.4tok/s
Prefill
216.93tok/s
TTFT
1.19s
显存占用
19.5GB
TTFB *
MTP 接受率
功耗
347.17W

数字是「llama.cpp · Q4_K_M」这个组合下 全部已上架记录的均值

TTFB 的单位尚待确认(原型标注为 GB,按录入原值展示)。

运行事实

实测显存占用
19.5 GB
NVIDIA RTX 4090 标称显存
24 GB

本站只收录实测数据。能不能在你的机器上跑起来,请对照你的显存、量化大小与上下文长度自行判断—— 我们没有你的硬件信息。

基本配置

这些字段逐条记录各不相同,因此只在全部记录取值相同时才在这里给出值。

框架版本
各条不同3 条中有 2 种取值看各条明细
操作系统
各条不同3 条中有 2 种取值看各条明细
驱动版本
各条不同3 条中有 2 种取值看各条明细
CUDA 版本
12.43/3 一致
上下文长度
各条不同3 条中有 2 种取值看各条明细
批大小
各条不同3 条中有 2 种取值看各条明细
GPU 层数
993/3 一致
Flash Attention
开启3/3 一致

硬件与模型

硬件
NVIDIA RTX 4090独立显卡
标称显存
24 GB
模型
Qwen3-32B
参数规模
32 B

横向对比

比的是「同一个模型 + 同一款硬件」下的不同框架与量化。点上面的按钮切换指标。

  1. llama.cpp · Q4_K_M 当前216.93 tok/s
  2. Ollama · Q4_K_M 198.2 tok/s

实测明细(3 条)

这一行的均值由下列记录算出。每一行是一次独立的实测,带各自的配置、证据等级与来源。

#框架版本操作系统驱动 / CUDA上下文批大小GPU 层Flash AttnDecodePrefill显存TTFTTTFBMTP功耗证据等级来源最后验证更新时间
1b4567Ubuntu 24.04550.107.02 / 12.4819251299开启18210.519.51.24342.5L0 自报GitHub2026-08-122026-09-18
2b4602Ubuntu 24.04550.107.02 / 12.48192未填99开启18.621819.41.18348L1 已复现GitHub2026-08-202026-09-18
3b4602Windows 11 24H2552.22 / 12.416384未填99开启18.6222.319.61.15351L2 跨框架验证Reddit2026-09-012026-09-18

表格可横向滚动查看更多列。

来源原文