你的机器,能跑什么 AI ?

基于真实运行数据,查询你硬件能跑的模型、框架、量化组合。 不只是速度,更告诉你:这条数据有多可靠,能不能直接比较,证据从哪里来。

热门搜索

11

运行记录

真实运行数据

4

硬件型号

主流显卡 / 处理器

3

模型

大模型 / 特色模型

3

框架

llama.cpp / vLLM 等

L0 / L1 / L2

证据等级

查看数据说明 →

最近运行记录

基于真实采集的数据,展示最新的模型运行结果。

查看全部 →

Qwen3-32B

L0 自报

Q4_K_M · llama.cpp b4567

  • NVIDIA RTX 4090
  • 24GB
  • Ubuntu 24.04
  • CUDA 12.4

18tok/s

Decode

210.5tok/s

Prefill

19.5GB

VRAM

  • NVIDIA
  • llama.cpp
  • 个人自报
来源: GitHub2026-09-18

Qwen3-32B

L1 已复现

Q4_K_M · llama.cpp b4602

  • NVIDIA RTX 4090
  • 24GB
  • Ubuntu 24.04
  • CUDA 12.4

18.6tok/s

Decode

218tok/s

Prefill

19.4GB

VRAM

  • NVIDIA
  • llama.cpp
  • 社区复现
来源: GitHub2026-09-18

Qwen3-32B

L2 跨框架验证

Q4_K_M · llama.cpp b4602

  • NVIDIA RTX 4090
  • 24GB
  • Windows 11 24H2
  • CUDA 12.4

18.6tok/s

Decode

222.3tok/s

Prefill

19.6GB

VRAM

  • NVIDIA
  • llama.cpp
  • 多框架对比
来源: Reddit2026-09-18

Qwen3-32B

L1 已复现

Q4_K_M · Ollama 0.5.7

  • NVIDIA RTX 4090
  • 24GB
  • Ubuntu 24.04
  • CUDA 12.4

17.4tok/s

Decode

198.2tok/s

Prefill

19.8GB

VRAM

  • NVIDIA
  • Ollama
  • 社区复现
来源: V2EX2026-09-18

为什么相信 Arao AI?

我们用结构化的证据体系,告诉你每条数据的可信度。

了解更多证据体系 →
L0 自报

来自社区或个人发布,未经过独立验证。

L1 已复现

社区复现,小规模独立验证,含复现次数。

L2 跨框架验证

同硬件 + 同模型,同量化下的多框架实测数据。