跑得动araoai.com
投稿
搜什么 常用 72 条 Run · 7 个模型 · 10 个硬件型号
怎么配

这个模型,在这台机器上怎么配

选好机器和模型,我们给你两套能直接照抄的方案:最快的那套最省显存的那套。 参数逐行列出来,命令拼好给你复制。全部来自别人的实测记录,每个数字都带着证据级别与样本量。

deepseek-ai/DeepSeek-R1-Distill-Qwen-14B 在 arc_a770 上怎么配

最快 按 decode_tps 最高 选出

deepseek-ai/DeepSeek-R1-Distill-Qwen-14BQ4_K_M L0 自报n=16

框架llama.cpp b5980

decode39.7tok/s 显存峰值11.2GB TTFT 冷启4280ms
硬件unknown:arc-a770

这个组合我们只有一条记录,所以「最快」与「最省显存」是同一条方案——这里不是两个方案碰巧一致,是我们还没有第二个方案可比。

参数逐行对照(只有一条记录,所以只有一列)
参数最快llama.cpp · Q4_K_M
框架 llama.cpp
框架版本 b5980
量化 Q4_K_M
上下文长度
KV cache 类型
Flash attention
GPU 层数 -1
decode 39.7
prefill 1336
TTFT 冷启 4280
TTFT 热启
显存峰值 11.2
证据级别 L0
样本量 16
来源 GitHub

— 的意思是来源没说这一项, 不是「关」也不是「0」。这一栏我们宁可留空,也不替来源补一个它没写过的值。 反过来,「关」是一个值——那是来源明确写了关闭。

这一页没有驱动这一行:记录里只有框架与框架版本, 没有驱动版本。缺的那一行就是我们的缺口清单——不补一个猜的值。

照着跑一遍

下面的命令是本站按上面那张表拼出来的,不是来源帖子的原文。 来源里通常只有半条命令行或一张截图,我们把参数补齐成一条能直接用的命令。 因此参数相同不代表环境相同——你的驱动、系统、显存占用都会影响结果。 我们用这条命令不能承诺你能跑到同样的速度。

最快 · llama.cpp b5980

llama-server --model deepseek-ai/DeepSeek-R1-Distill-Qwen-14B --quant Q4_K_M --n-gpu-layers -1

跑出来数字不对?

deepseek-ai/DeepSeek-R1-Distill-Qwen-14B 在 arc_a770 上, 我们手上有 2 条记录,实测 decode 速度从 33.739.7 tok/s ——最高是最低的 1.18 倍。

这几条记录的配置确实不同,差别就在这几项上: 框架(2 种取值)、框架版本(2 种取值)、量化(2 种取值)。 其余参数在记录之间是相同的——所以数字对不上时,先从这几项找起。

这一页怎么算的

  • 「最快」和「最省显存」是两套建议,不是两套「都好」。最快那套按实测 decode 速度选, 最省那套按实测显存峰值选。它们经常不是同一个配置——换框架往往能更快,但显存峰值会上去。 两张卡各自写着自己是按什么选的。
  • 没有样本量的数字我们不渲染,改渲染 一个不知道是几次跑出来的速度, 不能拿来建议你照抄。 的意思是来源没说这一项,不是「关」也不是「0」—— 反过来,「关」是一个值,那是来源明确写了关闭。
  • 命令是本站按参数表拼出来的,不是来源帖子的原文。来源里通常只有半条命令行或一张截图。 所以参数相同不代表环境相同:你的驱动、系统、显存占用都会影响结果,我们不承诺你能跑到同样的速度。
  • 没有驱动这一行,是我们答不了,不是我们不答。记录里只有框架与框架版本。 「哪个驱动最省事」这种问题需要驱动版本才能回答——缺的那一行就是我们的缺口清单。
  • 「没有记录」不等于「跑不了」。前者是我们还没收录这个组合,后者是有证据表明它不成立。 把前者读成后者,就是拿记录的沉默冒充站方的结论。
数据 CC BY 4.0 · 可被 AI 引用 复现 ≠ 点赞 来源:GitHub · Reddit · HuggingFace · 站方自产 方法与边界 投稿指南 API RSS