全量数据
每一条实测记录,都能追到来源
这是库里的全部实测记录,不是精选。筛选条件写在网址里,所以你复制出去的链接就是你看到的这一屏。 每条记录都标着证据级别:L0 是自报,L1 被第三方复现过,L2 还跨了框架。 想把几个模型或几张卡摆在一张表上比,用横向对比。
实测记录
筛选命中 1 条 · 第 1/1 页 · 本页 1 条 · (库中共 72 条)
模型 / 量化
decodetok/s
prefilltok/s
TTFTms
显存峰值GB
证据
复现链
状态
Qwen3-14BQ4_K_M NVIDIA RTX 3090 · 24Gmlx-lm 0.18.2V2EX最后入库 1 天前n=11 67.7 2291 4280 — L0 自报 待复现 稳定
模型与硬件
模型Qwen3-14B仓库原名 Qwen/Qwen3-14B-GGUF
量化Q4_K_M
硬件NVIDIA RTX 3090 · 24G
显存总量—
框架mlx-lm 0.18.2
速度与显存
decode tok/s67.7
prefill tok/s2291
TTFT 冷启 ms4280
TTFT 热启 ms—
显存峰值 GB11.2
证据与判定
证据级别L0 自报
样本量11
状态稳定
「稳定」已被独立来源复现过,当前没有已知分歧。
复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。
要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。
完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度—
KV cache—
flash attention—
batch—
GPU 层数-1
投机解码—
并发数—
上下文扩展—
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台V2EX
抓取时间1 天前
原文快照内容哈希
1dcaba3287fa3daadc52ea507541cff52b70f77bc7ae57131a46c6fa65373e97快照长度 89 字符(按码点计)我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。
相关断言
目前没有断言引用这条记录
高级元数据 5 项
配置指纹
配置签名95bb7d080802b2738a1683528359f76165bc2c541158d1883a39ebce07096e65
实验指标
KLD—
MTP 接受率—
整机功耗 W—
归一化
归一化未命中—
按模型看 · 按硬件看
每个取值一页点一个取值进去,就是它自己的页面:中位吞吐、区间、样本量与证据级别, 以及我们没有收录的组合——缺的那些写清楚是缺,不补数字。下面只列有记录的取值; 没有记录的不在这里,因为我们没有东西可说。
模型
怎么读这张表
- 证据级别不是我们自己打的标签。它由记录之间的相互验证推导:同一三元组被第三方用不同框架 跑出接近的数字,才升到 L1;跨框架也对得上,才是 L2。Arao 自产的记录即使带签名,在别人复现之前 仍然是 L0。
-
没有样本量的数字不显示。一行就是一个样本集,四个指标同源;样本量缺失时整行数字渲染
—,因为一个没有 n 的统计值不该被当成结论。 - 「跑不动」和「没有数据」是两回事。前者是有证据表明显存不够,后者是我们还没收录这个组合 ——把后者读成前者,就是拿机器的沉默冒充人的结论。
- 导出的上限是服务端强制的。当前视图最多导出 500 行;程序化取全量请走 API。