返回搜索结果

Qwen3.6-27B · Q5_K_S

NVIDIA RTX 3090 Ti24GBllama.cpp v0.3.0-e0663be2713cL0 自报

本页汇总 Qwen3.6-27B(Q5_K_S)在 NVIDIA RTX 3090 Ti 上以 llama.cpp 运行的 1 次实测数据,来自 1 个独立来源平台;指标为已上架实测的均值。

50.84 tok/s

Decode

解码速度

1,376.9 tok/s

Prefill

预填充速度

0.09 s

TTFT

首 token 延迟

22.47 GB

VRAM

显存占用

L0 自报

1

实测次数

1

独立来源

GitHub

来源平台

今天

最后验证

性能表现

  1. llama.cpp · Q5_K_S (当前)Decode 50.84 · Prefill 1376.9 ·

核心数据

Decode(平均)
50.84 tok/s
Prefill(平均)
1,376.9 tok/s
TTFT(平均)
0.09 s
VRAM(平均)
22.47 GB
MTP 接受率
TTFB
— GB
功耗
392.82 W

基础配置

成员级字段取自最近一次实测

模型
Qwen3.6-27B
量化方式
Q5_K_S
框架
llama.cpp
版本
v0.3.0-e0663be2713c
上下文长度
102400 tokens

硬件信息

标称与实测并排陈列,能否运行由读者自判

GPU
NVIDIA RTX 3090 Ti
标称显存
24 GB
实测显存(均值)
22.47 GB
系统
Ubuntu 24.04.4 LTS
驱动
580.159.03
CUDA
13.0
电源功耗
392.82 W

来源与证据

共 1 条实测记录,逐条可回溯到原始出处

  1. L0 自报GitHub原始链接 验证于 2026-09-20

    v0.3.0-e0663be2713c · Ubuntu 24.04.4 LTS · CUDA 13.0 · 102400 ctx

    50.84 tok/s

    Decode

    1,376.9 tok/s

    Prefill

    0.09 s

    TTFT

    22.47 GB

    VRAM

    MTP

    392.82 W

    功耗

    run-1 wall= 20.00s ttft= 80ms toks= 998 wall_TPS= 49.90 decode_TPS= 50.10 run-2 wall= 20.44s ttft= 91ms toks=1000 wall_TPS= 48.93 decode_TPS= 49.15 run-3 wall= 18.88s ttft= 81ms toks=1000 wall_TPS= 52.97 decode_TPS= 53.20 run-4 wall= 20.32s ttft= 83ms toks=1000 wall_TPS= 49.21 decode_TPS= 49.41 run-5 wall= 19.20s ttft= 92ms toks=1000 wall_TPS= 52.07 decode_TPS= 52.32