2x NVIDIA RTX 5090
台式机3
运行记录
3
覆盖模型
1
覆盖框架
L0 自报 × 3
证据分布
典型性能表现
同硬件上各模型 × 框架 × 量化的已上架实测均值。
- llama.cpp · UD-Q8_K_XL Decode 32.08 · Prefill 671.43 ·
- llama.cpp · UD-IQ4_XS Decode 21.96 · Prefill 421.07 ·
- llama.cpp · UD-IQ2_XXS Decode 19.39 · Prefill 692.41 ·
核心规格
- 显存
- 64 GB
运行记录
共 3 组配置
| 模型 | 框架 | 量化 | Decode | 样本数 |
|---|---|---|---|---|
| DeepSeek-V4-Flash-Vision-Exp | llama.cpp | UD-Q8_K_XL | 32.1 tok/s | 1 |
| GLM-5.3-Flash | llama.cpp | UD-IQ4_XS | 22 tok/s | 1 |
| DeepSeek-V4-Flash | llama.cpp | UD-IQ2_XXS | 19.4 tok/s | 1 |