Arao AI本地 AI 部署实测数据库

Llama-3.1-8B-Instruct · NVIDIA RTX 4060 Ti 16GB

llama.cpp · Q5_K_M · 由 1 条实测记录聚合(1 个来源类型)

实测指标

Decode
33.8tok/s
Prefill
620.4tok/s
TTFT
0.41s
显存占用
6.2GB
TTFB *
MTP 接受率
功耗
142.7W

数字是「llama.cpp · Q5_K_M」这个组合下 全部已上架记录的均值

TTFB 的单位尚待确认(原型标注为 GB,按录入原值展示)。

运行事实

实测显存占用
6.2 GB
NVIDIA RTX 4060 Ti 16GB 标称显存
16 GB

本站只收录实测数据。能不能在你的机器上跑起来,请对照你的显存、量化大小与上下文长度自行判断—— 我们没有你的硬件信息。

基本配置

这些字段逐条记录各不相同,因此只在全部记录取值相同时才在这里给出值。

框架版本
b46021/1 一致
操作系统
Windows 11 24H21/1 一致
驱动版本
552.221/1 一致
CUDA 版本
12.41/1 一致
上下文长度
81921/1 一致
批大小
未填1/1 一致
GPU 层数
991/1 一致
Flash Attention
开启1/1 一致

硬件与模型

硬件
NVIDIA RTX 4060 Ti 16GB独立显卡
标称显存
16 GB
模型
Llama-3.1-8B-Instruct
参数规模
8 B

横向对比

比的是「同一个模型 + 同一款硬件」下的不同框架与量化。点上面的按钮切换指标。

该模型 + 硬件下目前只有这一种配置,暂无横向对比。

  1. llama.cpp · Q5_K_M 当前620.4 tok/s

实测明细(1 条)

这一行的均值由下列记录算出。每一行是一次独立的实测,带各自的配置、证据等级与来源。

#框架版本操作系统驱动 / CUDA上下文批大小GPU 层Flash AttnDecodePrefill显存TTFTTTFBMTP功耗证据等级来源最后验证更新时间
1b4602Windows 11 24H2552.22 / 12.48192未填99开启33.8620.46.20.41142.7L1 已复现GitHub2026-08-052026-09-18

表格可横向滚动查看更多列。

来源原文