Arao AI本地 AI 部署实测数据库

DeepSeek-R1-Distill-Qwen-14B · NVIDIA RTX 4090

vLLM · AWQ-INT4 · 由 2 条实测记录聚合(2 个来源类型)

实测指标

Decode
63.6tok/s
Prefill
1192.75tok/s
TTFT
0.295s
显存占用
11.1GB
TTFB *
MTP 接受率
功耗
357.5W

数字是「vLLM · AWQ-INT4」这个组合下 全部已上架记录的均值

TTFB 的单位尚待确认(原型标注为 GB,按录入原值展示)。

运行事实

实测显存占用
11.1 GB
NVIDIA RTX 4090 标称显存
24 GB

本站只收录实测数据。能不能在你的机器上跑起来,请对照你的显存、量化大小与上下文长度自行判断—— 我们没有你的硬件信息。

基本配置

这些字段逐条记录各不相同,因此只在全部记录取值相同时才在这里给出值。

框架版本
0.7.32/2 一致
操作系统
Ubuntu 24.042/2 一致
驱动版本
550.107.022/2 一致
CUDA 版本
12.42/2 一致
上下文长度
327682/2 一致
批大小
各条不同2 条中有 2 种取值看各条明细
GPU 层数
未填2/2 一致
Flash Attention
未填2/2 一致

硬件与模型

硬件
NVIDIA RTX 4090独立显卡
标称显存
24 GB
模型
DeepSeek-R1-Distill-Qwen-14B
参数规模
14 B

横向对比

比的是「同一个模型 + 同一款硬件」下的不同框架与量化。点上面的按钮切换指标。

该模型 + 硬件下目前只有这一种配置,暂无横向对比。

  1. vLLM · AWQ-INT4 当前1192.75 tok/s

实测明细(2 条)

这一行的均值由下列记录算出。每一行是一次独立的实测,带各自的配置、证据等级与来源。

#框架版本操作系统驱动 / CUDA上下文批大小GPU 层Flash AttnDecodePrefill显存TTFTTTFBMTP功耗证据等级来源最后验证更新时间
10.7.3Ubuntu 24.04550.107.02 / 12.43276832未填未填62.31180.511.20.28356.8L2 跨框架验证GitHub2026-09-032026-09-18
20.7.3Ubuntu 24.04550.107.02 / 12.43276864未填未填64.91205110.31358.2L1 已复现Hugging Face2026-08-252026-09-18

表格可横向滚动查看更多列。

来源原文