GLM-5.3-Flash · UD-IQ4_XS
L0 自报2x NVIDIA RTX 5090 · 64GB · llama.cpp
GitHub
今天
21.96 tok/s
Decode
421.07 tok/s
Prefill
0.6 s
TTFT
60.3 GB
VRAM
配置(最近一次实测):
Ubuntu 24.04.4 LTS CUDA 13.3 UD-IQ4_XS llama.cpp moecachev1.6-rc0
来源:GitHub · 1 次实测 · 1 个独立来源