跑得动araoai.com
投稿
搜什么 常用 M3 Max × Qwen3-32BRX 7900 GRE · 未归一化 × Llama-3.1-8B-Instruct · 未归一化Qwen2.5-7B-Instruct · 未归一化 × mlx-lmQ4_K_M 72 条 Run · 7 个模型 · 10 个硬件型号
全量数据

每一条实测记录,都能追到来源

这是库里的全部实测记录,不是精选。筛选条件写在网址里,所以你复制出去的链接就是你看到的这一屏。 每条记录都标着证据级别:L0 是自报,L1 被第三方复现过,L2 还跨了框架。 想把几个模型或几张卡摆在一张表上比,用横向对比

重置

实测记录

筛选命中 7 条 · 第 1/1 页 · 本页 7 条 · (库中共 72 条)

模型 / 量化 decodetok/s prefilltok/s TTFTms 显存峰值GB 证据 复现链 状态
phi-4 · 未归一化Q5_K_M RTX 4080 SUPER · 未归一化ollama 0.5.1HuggingFace最后入库 1 天前n=12 43.3 1448 4863 L0 自报 待复现 稳定
模型与硬件
模型phi-4 · 未归一化仓库原名 microsoft/phi-4-GGUF
量化Q5_K_M
硬件RTX 4080 SUPER · 未归一化
显存总量
框架ollama 0.5.1
速度与显存
decode tok/s43.3
prefill tok/s1448
TTFT 冷启 ms4863
TTFT 热启 ms
显存峰值 GB12.8
证据与判定
证据级别L0 自报
样本量12
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台HuggingFace
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://huggingface.co/araoai-demo/phi-4-gguf-bench/discussions/9内容哈希 4fc4b10ee326b569d677d8105b70b4fe9d43696f9f3376382822cd0c2b9c2443快照长度 105 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名65fca85206af5ca8e721347aa33a9d4f4d660f36f330d2a58ada9d85ef6053a3
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rtx_4080_super;model: microsoft/phi-4-GGUF
Qwen3-14BQ4_K_M RTX 4080 SUPER · 未归一化mlx-lm 0.18.2Reddit最后入库 1 天前n=10 53.2 1802 4280 L0 自报 待复现 稳定
模型与硬件
模型Qwen3-14B仓库原名 Qwen/Qwen3-14B-GGUF
量化Q4_K_M
硬件RTX 4080 SUPER · 未归一化
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s53.2
prefill tok/s1802
TTFT 冷启 ms4280
TTFT 热启 ms
显存峰值 GB11.2
证据与判定
证据级别L0 自报
样本量10
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台Reddit
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.reddit.com/r/araoai_demo/comments/demo22_qwen3-14b-gguf/内容哈希 89d727e92c32437b608a36cda5f48d1cf6e8d2000026ee54ec4fe49da9e12372快照长度 97 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名ba3e19a5f050345b9d3f2fe003cad2cd4152a4d8cfe6abb180377ba69209af17
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rtx_4080_super
Qwen2.5-7B-Instruct · 未归一化AWQ 4-bit RTX 4080 SUPER · 未归一化mlx-lm 0.18.2B站最后入库 1 天前n=14 113.6 3843 2421 L0 自报 待复现 稳定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化AWQ 4-bit
硬件RTX 4080 SUPER · 未归一化
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s113.6
prefill tok/s3843
TTFT 冷启 ms2421
TTFT 热启 ms
显存峰值 GB6.1
证据与判定
证据级别L0 自报
样本量14
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台B站
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.bilibili.com/video/araoai-demo-26内容哈希 dd3a49fc26bcfe47f51a4bb5e49a27de94004d1c23785294b48664d26a887cee快照长度 112 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名385f913dd2135076d79fa9362bf0f8034ed117dea1214f37b79f27ecee633f7d
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rtx_4080_super;model: Qwen/Qwen2.5-7B-Instruct-GGUF
Qwen3-14BQ6_K RTX 4080 SUPER · 未归一化llama.cpp b6120Reddit最后入库 1 天前n=9 39.5 1343 5592 L0 自报 待复现 稳定
模型与硬件
模型Qwen3-14B仓库原名 Qwen/Qwen3-14B-GGUF
量化Q6_K
硬件RTX 4080 SUPER · 未归一化
显存总量
框架llama.cpp b6120
速度与显存
decode tok/s39.5
prefill tok/s1343
TTFT 冷启 ms5592
TTFT 热启 ms
显存峰值 GB14.8
证据与判定
证据级别L0 自报
样本量9
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台Reddit
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.reddit.com/r/araoai_demo/comments/demo36_qwen3-14b-gguf/内容哈希 726660ffadf474ce365efb2e632b86b7a0b4f9bd6797e929c43f93fbfef43378快照长度 100 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名4f00ebff9765da4c0aae864d13405442568a97d6124585847463b49e8468179c
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rtx_4080_super;quant: Q6_K
phi-4 · 未归一化AWQ 4-bit RTX 4080 SUPER · 未归一化llama.cpp b6120GitHub最后入库 1 天前n=14 57.9 1970 4061 L0 自报 待复现 稳定
模型与硬件
模型phi-4 · 未归一化仓库原名 microsoft/phi-4-GGUF
量化AWQ 4-bit
硬件RTX 4080 SUPER · 未归一化
显存总量
框架llama.cpp b6120
速度与显存
decode tok/s57.9
prefill tok/s1970
TTFT 冷启 ms4061
TTFT 热启 ms
显存峰值 GB10.6
证据与判定
证据级别L0 自报
样本量14
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台GitHub
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://github.com/araoai-demo/benchmarks/issues/1056内容哈希 063c8c1ad2e65d712036e43003b6c9f962adb43add4abb3571a25b4f5c877982快照长度 105 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名d01989b4c943612d2c2a62827091d45420c22873eddcc2de201f75a92578bf79
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rtx_4080_super;model: microsoft/phi-4-GGUF
DeepSeek-R1-Distill-Qwen-14B · 未归一化Q4_K_M RTX 4080 SUPER · 未归一化vLLM 0.6.2知乎最后入库 1 天前n=3 60.8 2127 4280 L0 自报 待复现 待判定
模型与硬件
模型DeepSeek-R1-Distill-Qwen-14B · 未归一化仓库原名 deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
量化Q4_K_M
硬件RTX 4080 SUPER · 未归一化
显存总量
框架vLLM 0.6.2
速度与显存
decode tok/s60.8
prefill tok/s2127
TTFT 冷启 ms4280
TTFT 热启 ms
显存峰值 GB11.2
证据与判定
证据级别L0 自报
样本量3
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台知乎
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://zhuanlan.zhihu.com/p/araoai-demo-60内容哈希 8f720e9c0a200827b6977addf2d108ba57667275ff87b072b4b4d63ccfc8f520快照长度 117 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名4fbe1f3471834ada2ee798fd33a1ee7268ce41da7bd4ca531063baa3959899fd
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rtx_4080_super;model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
Llama-3.1-8B-Instruct · 未归一化AWQ 4-bit RTX 4080 SUPER · 未归一化vLLM 0.6.2B站最后入库 1 天前n=4 113.6 3971 2655 L0 自报 待复现 待判定
模型与硬件
模型Llama-3.1-8B-Instruct · 未归一化仓库原名 meta-llama/Llama-3.1-8B-Instruct
量化AWQ 4-bit
硬件RTX 4080 SUPER · 未归一化
显存总量
框架vLLM 0.6.2
速度与显存
decode tok/s113.6
prefill tok/s3971
TTFT 冷启 ms2655
TTFT 热启 ms
显存峰值 GB6.7
证据与判定
证据级别L0 自报
样本量4
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台B站
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.bilibili.com/video/araoai-demo-61内容哈希 3bc90c7926e7769fde8c72d1946442d6318d8eb0c00758b6be4ce89a4ca5fcca快照长度 115 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名cb7364809d2bbd9dd935c55c9a61bd0912a340536bc83dab3d4ed2a4839a65d1
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rtx_4080_super;model: meta-llama/Llama-3.1-8B-Instruct
导出 CSV JSON 导出当前筛选的全部命中结果(上限 500 条)

按模型看 · 按硬件看

每个取值一页

点一个取值进去,就是它自己的页面:中位吞吐、区间、样本量与证据级别, 以及我们没有收录的组合——缺的那些写清楚是缺,不补数字。下面只列有记录的取值; 没有记录的不在这里,因为我们没有东西可说。

怎么读这张表

  • 证据级别不是我们自己打的标签。它由记录之间的相互验证推导:同一三元组被第三方用不同框架 跑出接近的数字,才升到 L1;跨框架也对得上,才是 L2。Arao 自产的记录即使带签名,在别人复现之前 仍然是 L0。
  • 没有样本量的数字不显示。一行就是一个样本集,四个指标同源;样本量缺失时整行数字渲染 ,因为一个没有 n 的统计值不该被当成结论。
  • 「跑不动」和「没有数据」是两回事。前者是有证据表明显存不够,后者是我们还没收录这个组合 ——把后者读成前者,就是拿机器的沉默冒充人的结论。
  • 导出的上限是服务端强制的。当前视图最多导出 500 行;程序化取全量请走 API
数据 CC BY 4.0 · 可被 AI 引用 复现 ≠ 点赞 来源:GitHub · Reddit · HuggingFace · Arao 自产 方法与边界 投稿指南 API RSS