Qwen/Qwen2.5-7B-Instruct-GGUFAWQ 4-bit L0 自报n=11
框架mlx-lm 0.18.2
这个组合我们只有一条记录,所以「最快」与「最省显存」是同一条方案——这里不是两个方案碰巧一致,是我们还没有第二个方案可比。
选好机器和模型,我们给你两套能直接照抄的方案:最快的那套和最省显存的那套。 参数逐行列出来,命令拼好给你复制。全部来自别人的实测记录,每个数字都带着证据级别与样本量。
Qwen/Qwen2.5-7B-Instruct-GGUFAWQ 4-bit L0 自报n=11
框架mlx-lm 0.18.2
这个组合我们只有一条记录,所以「最快」与「最省显存」是同一条方案——这里不是两个方案碰巧一致,是我们还没有第二个方案可比。
| 参数 | 最快mlx-lm · AWQ 4-bit |
|---|---|
| 框架 | mlx-lm |
| 框架版本 | 0.18.2 |
| 量化 | AWQ 4-bit |
| 上下文长度 | — |
| KV cache 类型 | — |
| Flash attention | — |
| GPU 层数 | -1 |
| decode | 55.6 |
| prefill | 1880 |
| TTFT 冷启 | 2421 |
| TTFT 热启 | — |
| 显存峰值 | 6.1 |
| 证据级别 | L0 |
| 样本量 | 11 |
| 来源 | 知乎 |
— 的意思是来源没说这一项, 不是「关」也不是「0」。这一栏我们宁可留空,也不替来源补一个它没写过的值。 反过来,「关」是一个值——那是来源明确写了关闭。
这一页没有驱动这一行:记录里只有框架与框架版本, 没有驱动版本。缺的那一行就是我们的缺口清单——不补一个猜的值。
下面的命令是本站按上面那张表拼出来的,不是来源帖子的原文。 来源里通常只有半条命令行或一张截图,我们把参数补齐成一条能直接用的命令。 因此参数相同不代表环境相同——你的驱动、系统、显存占用都会影响结果。 我们用这条命令不能承诺你能跑到同样的速度。
Qwen/Qwen2.5-7B-Instruct-GGUF 在 rtx_3060 上, 我们手上有 2 条记录,实测 decode 速度从 44.6 到 55.6 tok/s ——最高是最低的 1.25 倍。
这几条记录的配置确实不同,差别就在这几项上: 量化(2 种取值)。 其余参数在记录之间是相同的——所以数字对不上时,先从这几项找起。
—。一个不知道是几次跑出来的速度,
不能拿来建议你照抄。— 的意思是来源没说这一项,不是「关」也不是「0」——
反过来,「关」是一个值,那是来源明确写了关闭。