跑得动araoai.com
投稿
搜什么 常用 72 条 Run · 7 个模型 · 10 个硬件型号
单条实测记录

deepseek-ai/DeepSeek-R1-Distill-Qwen-14B · Q4_K_M

在 rtx_3060 上, 用 ExLlamaV2 0.2.5 跑出来的读数。 下面每一项都来自这条记录本身——我们没有替它补过任何字段。

L0 自报 待复现 最后入库 19 小时前 记录号 pipeline-run-3

这条记录的全部字段

的意思是来源没说这一项——不是「关」,也不是「0」。 记录里没有的字段我们也列出来,那样你才看得出这是我们的缺口,而不是这一页不问它。

完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB11.2
显存总量
样本量6
复现次数0
硬件rtx_3060
模型deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名d290bbf297d934829b28a3863e97a89f4031890ad54ff9d8fd8eb729e0270cd8
复现链
窄屏隐藏的列
框架ExLlamaV2 0.2.5
prefill tok/s971
TTFT 冷启 ms4280
decode tok/s28.2
归一化未命中hardware: rtx_3060;model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台V2EX
抓取时间19 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

用同样的配置跑一遍

这段是本站按上面这些字段拼出来的,不是来源帖子的原文——来源里通常只有半条命令行或一张截图。 参数相同不代表环境相同:你的驱动、系统、后台占用都会影响结果,我们不承诺你能跑到同样的速度。

ExLlamaV2 0.2.5 的命令我们还不会拼。 我们只对你也能核对的框架(llama.cpp / ollama / vLLM)生成命令——拼一条我们没验证过的 命令行给你,比不给更糟。参数仍在上面的字段表里,可以照着手工拼。

「跑完把结果交回来」这个入口(投稿)还没有上线。现在能做的只有把配置抄走,到自己的机器上跑一遍。

这一页怎么读

  • 的意思是来源没说这一项,不是「关」,也不是「0」。 反过来,「否」是一个值:那是来源明确写了关闭。两件事我们分开渲染。
  • 没有样本量的记录,指标一律显示 一个不知道是几次跑出来的速度, 不能拿来照着抄。这条纪律在表格、导出、展开体和这一页四处完全一致。
  • 「跑不动」的记录指标照常显示。那正是"跑不动"的依据——比如显存峰值超过了这台 机器的总量。把指标藏起来,结论就变成了没有依据的断言。
  • 原文快照我们没有。只存了来源链接与抓取时间。来源被删或改版后, 这一页保留的是当时的读数,无法再对上原文——这是我们的缺口,不是你的。
  • 一条记录只是一个读数,不是一条结论。同一个组合下的不同记录可能差出一倍 (框架、驱动、后台占用都会影响)。要判断"该用哪个配置", 看「怎么配」那一页的对照,而不是只看这一条。
数据 CC BY 4.0 · 可被 AI 引用 复现 ≠ 点赞 来源:GitHub · Reddit · HuggingFace · 站方自产 方法与边界 投稿指南 API RSS