DeepSeek-V4-Flash-Vision-Exp · UD-Q8_K_XL
L0 自报2x NVIDIA RTX 5090 · 64GB · llama.cpp
GitHub
今天
32.08 tok/s
Decode
671.43 tok/s
Prefill
0.12 s
TTFT
60.7 GB
VRAM
配置(最近一次实测):
Ubuntu 24.04.4 LTS CUDA 13.3 UD-Q8_K_XL llama.cpp moecachev1.6-rc0
来源:GitHub · 1 次实测 · 1 个独立来源