跑得动araoai.com
投稿
搜什么 常用 M3 Max × Qwen3-32BRX 7900 GRE · 未归一化 × Llama-3.1-8B-Instruct · 未归一化Qwen2.5-7B-Instruct · 未归一化 × mlx-lmQ4_K_M 72 条 Run · 7 个模型 · 10 个硬件型号
硬件

Apple M3 Max · 128G 统一内存在我们记录里的实测

关于这台机器,我们收录了 11 条记录。 这一页把它们摊开:中位吞吐与区间、每一行的样本量与证据级别,以及我们没有收录的组合 ——缺的那些我们不会替你补一个数字。

先说结论 · 这台机器在我们记录里的样子

在当前记录里,Apple M3 Max · 128G 统一内存 的解码吞吐中位数是 28.9 tok/s (8.7 – 70.5,n=123,共 11 条记录), 最高证据级别是 L1 已复现

中位出词28.9 tok/s区间8.7 – 70.5样本量n=123记录数11覆盖模型6框架覆盖4独立复现1标称显存128 GB最高证据L1 已复现

在这些模型里,Qwen2.5-7B-Instruct · 未归一化 的中位数最高(中位 58.8 tok/s, n=15,证据 L0)。 这是表里数字的高低,不是我们在替你选——样本量、量化档、框架都不同,能核对的都在表里。

模型 × 这台机器

6 个模型 · 11 条记录

同一台机器上不同模型之间的数字也不是同一件事:量化档、框架、上下文长度都会影响结果。 这张表只回答「我们在这个组合上测到过什么」。

行按记录条数降序排列——条数是「我们有多少条观测」,不是「谁更强」:不同模型之间的量化档、框架、上下文长度都不一样。每一行的 n= 是那一格参与统计的样本量之和;没有有效样本量的格子不渲染数字,渲染 —— 是"我们不知道",不是 0。

同一台机器上各模型的实测中位(按记录条数降序)
模型 decode 中位 区间 记录数 证据
DeepSeek-R1-Distill-Qwen-14B · 未归一化 12.3tok/sn=278.7 – 16.0tok/s 2占 18% L0 自报
Llama-3.1-8B-Instruct · 未归一化 38.0tok/sn=1132.7 – 43.4tok/s 2占 18% L0 自报
phi-4 · 未归一化 29.5tok/sn=2928.9 – 30.2tok/s 2占 18% L0 自报
Qwen2.5-7B-Instruct · 未归一化 58.8tok/sn=1547.1 – 70.5tok/s 2占 18% L0 自报
Qwen3-32B32B 11.8tok/sn=2810.6 – 12.9tok/s 2占 18% L0 自报
Qwen3-14B14B 15.5tok/sn=1315.5 – 15.5tok/s 1占 9% L1 已复现

表里没有 Mistral-Nemo-Instruct-2407 · 未归一化我们还没收录这个组合「没有数据」不等于「跑不动」——前者是我们还没收录,后者是有证据表明显存不够。 把前者读成后者,就是拿记录的沉默冒充站方的结论。这不是模型的问题,是我们的缺口。

全部实测记录

含跑不通的
模型 / 量化 decodetok/s prefilltok/s TTFTms 显存峰值GB 证据 复现链 状态
Llama-3.1-8B-Instruct · 未归一化Q8_0 vLLM 0.6.2HuggingFace最后入库 1 天前n=5 32.7 1142 4322 L0 自报 待复现 待判定
模型与硬件
模型Llama-3.1-8B-Instruct · 未归一化仓库原名 meta-llama/Llama-3.1-8B-Instruct
量化Q8_0
硬件Apple M3 Max · 128G 统一内存
显存总量
框架vLLM 0.6.2
速度与显存
decode tok/s32.7
prefill tok/s1142
TTFT 冷启 ms4322
TTFT 热启 ms
显存峰值 GB11.3
证据与判定
证据级别L0 自报
样本量5
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台HuggingFace
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://huggingface.co/araoai-demo/llama-3-1-8b-instruct-bench/discussions/2内容哈希 c895ec078434a9ab4cbd8f8c079edcd2b10a03a66ffb936dd609c23dad404bd5快照长度 111 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名79b2a51fcd3d178d1ee5d2070e329d3c7d87f872c24c0e50788a3e6c9881e436
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中model: meta-llama/Llama-3.1-8B-Instruct
Qwen2.5-7B-Instruct · 未归一化AWQ 4-bit vLLM 0.6.2知乎最后入库 1 天前n=7 70.5 2466 2421 L0 自报 待复现 待判定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化AWQ 4-bit
硬件Apple M3 Max · 128G 统一内存
显存总量
框架vLLM 0.6.2
速度与显存
decode tok/s70.5
prefill tok/s2466
TTFT 冷启 ms2421
TTFT 热启 ms
显存峰值 GB6.1
证据与判定
证据级别L0 自报
样本量7
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台知乎
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://zhuanlan.zhihu.com/p/araoai-demo-4内容哈希 60d005bd9960ed1e5a9d1197df7f468eb9e22b9e100bdf0ad1ce480de3b46bad快照长度 106 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名1a7de696fb9be50cf2e6941e9361aaf080c9732e74b19a0278b6153b0e7e76e2
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中model: Qwen/Qwen2.5-7B-Instruct-GGUF
Qwen3-14BQ8_0 ollama 0.5.1V2EX最后入库 1 天前n=13 15.5 519 6978 L1 已复现 1 次 稳定
模型与硬件
模型Qwen3-14B仓库原名 Qwen/Qwen3-14B-GGUF
量化Q8_0
硬件Apple M3 Max · 128G 统一内存
显存总量
框架ollama 0.5.1
速度与显存
decode tok/s15.5
prefill tok/s519
TTFT 冷启 ms6978
TTFT 热启 ms
显存峰值 GB18.6
证据与判定
证据级别L1 已复现 1 次
样本量13
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数1
测量方第三方实测
复现链
原始来源
平台V2EX
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.v2ex.com/t/araoai-demo-10内容哈希 47070de7141e7693842cafe0aa806eeda8d2f22ec8e54df692db6bb5a924324a快照长度 93 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名6e3a3c0e88bb466c4e94b52eeac7cbf04569ba7ed6f56e8421fe282362d38ecb
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中
Qwen3-32BQ4_K_M llama.cpp b6120Arao 自产最后入库 1 天前n=16 12.9 439 8780 L0 自报 待复现 稳定
模型与硬件
模型Qwen3-32B仓库原名 Qwen/Qwen3-32B-GGUF
量化Q4_K_M
硬件Apple M3 Max · 128G 统一内存
显存总量
框架llama.cpp b6120
速度与显存
decode tok/s12.9
prefill tok/s439
TTFT 冷启 ms8780
TTFT 热启 ms
显存峰值 GB23.5
证据与判定
证据级别L0 自报
样本量16
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方Arao 实测
复现链待复现
原始来源
平台Arao 自产
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://araoai.com/demo/rig-run-13内容哈希 9612fc08f49fc9c539e049eb6d17e7fb88f0a099cec67c48404b51e3027b3c0c快照长度 98 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名379c3b8d39020e50dce9f3a55895f19d01459e727e2071e33adc2503e8e8a652
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中
phi-4 · 未归一化AWQ 4-bit llama.cpp b5980知乎最后入库 1 天前n=13 30.2 1018 4061 L0 自报 待复现 稳定
模型与硬件
模型phi-4 · 未归一化仓库原名 microsoft/phi-4-GGUF
量化AWQ 4-bit
硬件Apple M3 Max · 128G 统一内存
显存总量
框架llama.cpp b5980
速度与显存
decode tok/s30.2
prefill tok/s1018
TTFT 冷启 ms4061
TTFT 热启 ms
显存峰值 GB10.6
证据与判定
证据级别L0 自报
样本量13
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台知乎
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://zhuanlan.zhihu.com/p/araoai-demo-25内容哈希 24b35ba3cf56e28d668b8f48b5acadc6f0a26c8b1bfb4e88356985842af319f2快照长度 102 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名8f31c4de18a7aa7b1c90113134eb508d87338c47a9436cb41a3739740d1806b0
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中model: microsoft/phi-4-GGUF
Qwen2.5-7B-Instruct · 未归一化Q5_K_M ollama 0.5.1GitHub最后入库 1 天前n=8 47.1 1574 2822 L0 自报 待复现 稳定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q5_K_M
硬件Apple M3 Max · 128G 统一内存
显存总量
框架ollama 0.5.1
速度与显存
decode tok/s47.1
prefill tok/s1574
TTFT 冷启 ms2822
TTFT 热启 ms
显存峰值 GB7.2
证据与判定
证据级别L0 自报
样本量8
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台GitHub
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://github.com/araoai-demo/benchmarks/issues/1035内容哈希 c7cc3d6a505e3c0a3fab999bc021cd1a30c9a62628bcd196c820bc325adde978快照长度 107 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名17e6f85f327bf96fc56441c41bbbdb40d4afc95da70de74119e68a5fe3bd6c20
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中model: Qwen/Qwen2.5-7B-Instruct-GGUF
DeepSeek-R1-Distill-Qwen-14B · 未归一化FP16 mlx-lm 0.18.2知乎最后入库 1 天前n=12 8.7 294 12447 L0 自报 待复现 稳定
模型与硬件
模型DeepSeek-R1-Distill-Qwen-14B · 未归一化仓库原名 deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
量化FP16
硬件Apple M3 Max · 128G 统一内存
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s8.7
prefill tok/s294
TTFT 冷启 ms12447
TTFT 热启 ms
显存峰值 GB33.5
证据与判定
证据级别L0 自报
样本量12
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台知乎
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://zhuanlan.zhihu.com/p/araoai-demo-39内容哈希 3370b8e094c5fdd2d75fd4e69b8f8f22d9ed9b67f25bb36c5b3b250e02f19abe快照长度 112 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名a2f9fefe6f6f580d967fff24c07c293b0a22799c2ecddaeded693a2ea850159a
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
phi-4 · 未归一化Q4_K_M mlx-lm 0.18.2Reddit最后入库 1 天前n=16 28.9 979 4280 L0 自报 待复现 稳定
模型与硬件
模型phi-4 · 未归一化仓库原名 microsoft/phi-4-GGUF
量化Q4_K_M
硬件Apple M3 Max · 128G 统一内存
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s28.9
prefill tok/s979
TTFT 冷启 ms4280
TTFT 热启 ms
显存峰值 GB11.2
证据与判定
证据级别L0 自报
样本量16
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台Reddit
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.reddit.com/r/araoai_demo/comments/demo43_phi-4-gguf/内容哈希 e24ee36646b5052416a04967c0c58ac9848e2bd84b930d27bdc3c1b88339ace6快照长度 96 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名af83e43a101ba7263fc7dd251a6f0c131a923373acc333a1bac2656f72f4fe89
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中model: microsoft/phi-4-GGUF
DeepSeek-R1-Distill-Qwen-14B · 未归一化Q8_0 llama.cpp b5980Reddit最后入库 1 天前n=15 16.0 539 6978 L0 自报 待复现 稳定
模型与硬件
模型DeepSeek-R1-Distill-Qwen-14B · 未归一化仓库原名 deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
量化Q8_0
硬件Apple M3 Max · 128G 统一内存
显存总量
框架llama.cpp b5980
速度与显存
decode tok/s16.0
prefill tok/s539
TTFT 冷启 ms6978
TTFT 热启 ms
显存峰值 GB18.6
证据与判定
证据级别L0 自报
样本量15
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台Reddit
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.reddit.com/r/araoai_demo/comments/demo57_deepseek-r1-distill-qwen-14b/内容哈希 50c5a4dc67ccf38b8cd57b568b0c89bf8d374dc8b9c0af05d969470f169d51c5快照长度 119 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名79caf35df754093fece2961398c480b171488acfc913aef2904d7c3b04570a71
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
Llama-3.1-8B-Instruct · 未归一化Q5_K_M mlx-lm 0.18.2GitHub最后入库 1 天前n=6 43.4 1469 3113 L0 自报 待复现 待判定
模型与硬件
模型Llama-3.1-8B-Instruct · 未归一化仓库原名 meta-llama/Llama-3.1-8B-Instruct
量化Q5_K_M
硬件Apple M3 Max · 128G 统一内存
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s43.4
prefill tok/s1469
TTFT 冷启 ms3113
TTFT 热启 ms
显存峰值 GB8.0
证据与判定
证据级别L0 自报
样本量6
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台GitHub
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://github.com/araoai-demo/benchmarks/issues/1063内容哈希 bf039634e13290b6341afb90614b71b4b4f60ac13bf0d2428f7550629bd4ffb0快照长度 108 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名800faa438d922a5721abf378fc29b69f3e94fbabd96cfdf1e05a7e5d81a428a4
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中model: meta-llama/Llama-3.1-8B-Instruct
Qwen3-32BQ5_K_M llama.cpp b5980Arao 自产最后入库 1 天前n=12 10.6 358 10113 L0 自报 待复现 稳定
模型与硬件
模型Qwen3-32B仓库原名 Qwen/Qwen3-32B-GGUF
量化Q5_K_M
硬件Apple M3 Max · 128G 统一内存
显存总量
框架llama.cpp b5980
速度与显存
decode tok/s10.6
prefill tok/s358
TTFT 冷启 ms10113
TTFT 热启 ms
显存峰值 GB27.1
证据与判定
证据级别L0 自报
样本量12
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方Arao 实测
复现链待复现
原始来源
平台Arao 自产
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://araoai.com/demo/rig-run-69内容哈希 40879ee3def7791add4e838fc4621635fda46e861bb8838f7f10db7323a8eda2快照长度 98 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名75f6549ca09230f3cd2a7bee3136ef679a4e1f1c95ce65d5af914243818ef62c
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中

这一页怎么算的

三件我们不做的事
  • 只列有记录的模型。这台机器上某个模型一条记录都没有时,表里没有这一行, 我们只会在表下把它点名——不会渲染一个 0, 也不会把它写进「跑不动」那一类。那是两件事:前者是我们还没收录,后者是有证据表明显存不够。
  • 「跑不动」也是一条记录。下面那张完整表里,标着「跑不动」的行照常渲染, 并带着自己的证据级别——把它们藏起来等于只给你看赢的那些,那不叫数据。
  • 不给"该跑哪个模型"这类排序。表按记录条数降序(那是"我们有多少观测"); 「中位数最高」那种句子是可核对的陈述。同一台机器上不同模型之间的量化档、框架、 上下文长度都不一样,所以"哪个更好"这种问题我们不答——记录里没有能力字段,答了就是编。
数据 CC BY 4.0 · 可被 AI 引用 复现 ≠ 点赞 来源:GitHub · Reddit · HuggingFace · Arao 自产 方法与边界 投稿指南 API RSS