Arao AI本地 AI 部署实测数据库

Qwen3-32B · NVIDIA RTX 4090

Ollama · Q4_K_M · 由 1 条实测记录聚合(1 个来源类型)

实测指标

Decode
17.4tok/s
Prefill
198.2tok/s
TTFT
1.31s
显存占用
19.8GB
TTFB *
MTP 接受率
功耗
339W

数字是「Ollama · Q4_K_M」这个组合下 全部已上架记录的均值

TTFB 的单位尚待确认(原型标注为 GB,按录入原值展示)。

运行事实

实测显存占用
19.8 GB
NVIDIA RTX 4090 标称显存
24 GB

本站只收录实测数据。能不能在你的机器上跑起来,请对照你的显存、量化大小与上下文长度自行判断—— 我们没有你的硬件信息。

基本配置

这些字段逐条记录各不相同,因此只在全部记录取值相同时才在这里给出值。

框架版本
0.5.71/1 一致
操作系统
Ubuntu 24.041/1 一致
驱动版本
550.107.021/1 一致
CUDA 版本
12.41/1 一致
上下文长度
81921/1 一致
批大小
未填1/1 一致
GPU 层数
未填1/1 一致
Flash Attention
未填1/1 一致

硬件与模型

硬件
NVIDIA RTX 4090独立显卡
标称显存
24 GB
模型
Qwen3-32B
参数规模
32 B

横向对比

比的是「同一个模型 + 同一款硬件」下的不同框架与量化。点上面的按钮切换指标。

  1. llama.cpp · Q4_K_M 18.4 tok/s
  2. Ollama · Q4_K_M 当前17.4 tok/s

实测明细(1 条)

这一行的均值由下列记录算出。每一行是一次独立的实测,带各自的配置、证据等级与来源。

#框架版本操作系统驱动 / CUDA上下文批大小GPU 层Flash AttnDecodePrefill显存TTFTTTFBMTP功耗证据等级来源最后验证更新时间
10.5.7Ubuntu 24.04550.107.02 / 12.48192未填未填未填17.4198.219.81.31339L1 已复现V2EX2026-08-282026-09-18

表格可横向滚动查看更多列。

来源原文