跑得动araoai.com
投稿
搜什么 常用 M3 Max × Qwen3-32BRX 7900 GRE · 未归一化 × Llama-3.1-8B-Instruct · 未归一化Qwen2.5-7B-Instruct · 未归一化 × mlx-lmQ4_K_M 72 条 Run · 7 个模型 · 10 个硬件型号
硬件

M2 Ultra · 未归一化在我们记录里的实测

关于这台机器,我们收录了 8 条记录。 这一页把它们摊开:中位吞吐与区间、每一行的样本量与证据级别,以及我们没有收录的组合 ——缺的那些我们不会替你补一个数字。

先说结论 · 这台机器在我们记录里的样子

在当前记录里,M2 Ultra · 未归一化 的解码吞吐中位数是 40.9 tok/s (17.7 – 109.8,n=80,共 8 条记录), 最高证据级别是 L1 已复现

中位出词40.9 tok/s区间17.7 – 109.8样本量n=80记录数8覆盖模型4框架覆盖4独立复现1标称显存最高证据L1 已复现

在这些模型里,Qwen2.5-7B-Instruct · 未归一化 的中位数最高(中位 91.0 tok/s, n=32,证据 L0)。 这是表里数字的高低,不是我们在替你选——样本量、量化档、框架都不同,能核对的都在表里。

模型 × 这台机器

4 个模型 · 8 条记录

同一台机器上不同模型之间的数字也不是同一件事:量化档、框架、上下文长度都会影响结果。 这张表只回答「我们在这个组合上测到过什么」。

行按记录条数降序排列——条数是「我们有多少条观测」,不是「谁更强」:不同模型之间的量化档、框架、上下文长度都不一样。每一行的 n= 是那一格参与统计的样本量之和;没有有效样本量的格子不渲染数字,渲染 —— 是"我们不知道",不是 0。

同一台机器上各模型的实测中位(按记录条数降序)
模型 decode 中位 区间 记录数 证据
Qwen2.5-7B-Instruct · 未归一化 91.0tok/sn=3234.7 – 109.8tok/s 3占 38% L0 自报
Qwen3-14B14B 33.3tok/sn=2417.7 – 47.1tok/s 3占 38% L1 已复现
Mistral-Nemo-Instruct-2407 · 未归一化 73.0tok/sn=1473.0 – 73.0tok/s 1占 13% L0 自报
Qwen3-32B32B 25.8tok/sn=1025.8 – 25.8tok/s 1占 13% L0 自报

表里没有 DeepSeek-R1-Distill-Qwen-14B · 未归一化Llama-3.1-8B-Instruct · 未归一化phi-4 · 未归一化我们还没收录这个组合「没有数据」不等于「跑不动」——前者是我们还没收录,后者是有证据表明显存不够。 把前者读成后者,就是拿记录的沉默冒充站方的结论。这不是模型的问题,是我们的缺口。

全部实测记录

含跑不通的
模型 / 量化 decodetok/s prefilltok/s TTFTms 显存峰值GB 证据 复现链 状态
Mistral-Nemo-Instruct-2407 · 未归一化Q4_K_M ExLlamaV2 0.2.5知乎最后入库 1 天前n=14 73.0 2518 3780 L0 自报 待复现 稳定
模型与硬件
模型Mistral-Nemo-Instruct-2407 · 未归一化仓库原名 mistralai/Mistral-Nemo-Instruct-2407
量化Q4_K_M
硬件M2 Ultra · 未归一化
显存总量
框架ExLlamaV2 0.2.5
速度与显存
decode tok/s73.0
prefill tok/s2518
TTFT 冷启 ms3780
TTFT 热启 ms
显存峰值 GB9.8
证据与判定
证据级别L0 自报
样本量14
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台知乎
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://zhuanlan.zhihu.com/p/araoai-demo-11内容哈希 78a8d6cdcd874ae93a5b48048096cb19437ba5012a7134802f331d9a5b998757快照长度 118 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名482e4c48a4d56aa1cbdf96aac65c89a6e3d0717105f5690d0bfabc09cece89db
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: apple_m2_ultra;model: mistralai/Mistral-Nemo-Instruct-2407
Qwen2.5-7B-Instruct · 未归一化Q4_K_M ollama 0.5.1知乎最后入库 1 天前n=6 109.8 3673 2530 L0 自报 待复现 待判定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q4_K_M
硬件M2 Ultra · 未归一化
显存总量
框架ollama 0.5.1
速度与显存
decode tok/s109.8
prefill tok/s3673
TTFT 冷启 ms2530
TTFT 热启 ms
显存峰值 GB6.4
证据与判定
证据级别L0 自报
样本量6
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台知乎
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://zhuanlan.zhihu.com/p/araoai-demo-18内容哈希 5fe2fcda65165778b8e3e643761d435cc64e96c4ee177644a4b2833400289305快照长度 109 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名e3fae782b34f915b8d6977a371d1b49ec73ae9a11362ba511018091193e4d0df
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: apple_m2_ultra;model: Qwen/Qwen2.5-7B-Instruct-GGUF
Qwen2.5-7B-Instruct · 未归一化FP16 mlx-lm 0.18.2HuggingFace最后入库 1 天前n=11 34.7 1175 6613 L0 自报 待复现 稳定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化FP16
硬件M2 Ultra · 未归一化
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s34.7
prefill tok/s1175
TTFT 冷启 ms6613
TTFT 热启 ms
显存峰值 GB17.6
证据与判定
证据级别L0 自报
样本量11
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台HuggingFace
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://huggingface.co/araoai-demo/qwen2-5-7b-instruct-gguf-bench/discussions/23内容哈希 b07b7486f883f6497d8e2e2d6327eeb55fc5b3a32683c8fafe16e37244db4898快照长度 110 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名94e8f9ff6c38c0b87b76605ee4993ceefc26bc9eb6a2537c3bdbf859c2004bb9
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: apple_m2_ultra;model: Qwen/Qwen2.5-7B-Instruct-GGUF
Qwen2.5-7B-Instruct · 未归一化Q6_K ExLlamaV2 0.2.5Arao 自产最后入库 1 天前n=15 91.0 3139 3186 L0 自报 待复现 稳定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q6_K
硬件M2 Ultra · 未归一化
显存总量
框架ExLlamaV2 0.2.5
速度与显存
decode tok/s91.0
prefill tok/s3139
TTFT 冷启 ms3186
TTFT 热启 ms
显存峰值 GB8.2
证据与判定
证据级别L0 自报
样本量15
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方Arao 实测
复现链待复现
原始来源
平台Arao 自产
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://araoai.com/demo/rig-run-27内容哈希 14315352e0b51fb5cd03764f76d82d90d8a590460c9da147c59f692a616ede9c快照长度 108 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名9fc83d347256c63684f4e0b2c317213924a1e4e1197a04824506d2c773863033
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: apple_m2_ultra;model: Qwen/Qwen2.5-7B-Instruct-GGUF;quant: Q6_K
Qwen3-14BFP16 llama.cpp b6120B站最后入库 1 天前n=6 17.7 602 12447 L0 自报 待复现 待判定
模型与硬件
模型Qwen3-14B仓库原名 Qwen/Qwen3-14B-GGUF
量化FP16
硬件M2 Ultra · 未归一化
显存总量
框架llama.cpp b6120
速度与显存
decode tok/s17.7
prefill tok/s602
TTFT 冷启 ms12447
TTFT 热启 ms
显存峰值 GB33.5
证据与判定
证据级别L0 自报
样本量6
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台B站
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.bilibili.com/video/araoai-demo-33内容哈希 999d5fbf498ec72bf83539511d00b87f70c1f71b7016491e489cc3c9026eb31e快照长度 102 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名67db19afbc2798a5bf8dfe333985f317b6e048529ce1bba92415c2af02725bf1
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: apple_m2_ultra
Qwen3-14BQ5_K_M ollama 0.5.1Reddit最后入库 1 天前n=7 47.1 1574 4863 L1 已复现 1 次 待判定
模型与硬件
模型Qwen3-14B仓库原名 Qwen/Qwen3-14B-GGUF
量化Q5_K_M
硬件M2 Ultra · 未归一化
显存总量
框架ollama 0.5.1
速度与显存
decode tok/s47.1
prefill tok/s1574
TTFT 冷启 ms4863
TTFT 热启 ms
显存峰值 GB12.8
证据与判定
证据级别L1 已复现 1 次
样本量7
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数1
测量方第三方实测
复现链
原始来源
平台Reddit
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.reddit.com/r/araoai_demo/comments/demo64_qwen3-14b-gguf/内容哈希 cae40cd8489c6e46cdc6318703ed211b3df949505c6fa40b858783229b616ff5快照长度 99 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名0f2df13e735afd5bc8a6cd81023194ccd354bf9821ec307cb37092ff73e3284a
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: apple_m2_ultra
Qwen3-32BQ4_K_M llama.cpp b6120知乎最后入库 1 天前n=10 25.8 878 8780 L0 自报 待复现 稳定
模型与硬件
模型Qwen3-32B仓库原名 Qwen/Qwen3-32B-GGUF
量化Q4_K_M
硬件M2 Ultra · 未归一化
显存总量
框架llama.cpp b6120
速度与显存
decode tok/s25.8
prefill tok/s878
TTFT 冷启 ms8780
TTFT 热启 ms
显存峰值 GB23.5
证据与判定
证据级别L0 自报
样本量10
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台知乎
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://zhuanlan.zhihu.com/p/araoai-demo-67内容哈希 e2d31d52b21f91f7632e7d156ead09986ae90e0f4bfd78c95ccde9d2f2e27aab快照长度 101 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名d1261fd1d256c447488e4bf13b749ea9b518d11df2812594307fc7966eb48c49
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: apple_m2_ultra
Qwen3-14BQ8_0 llama.cpp b6120B站最后入库 1 天前n=11 33.3 1134 6978 L0 自报 待复现 稳定
模型与硬件
模型Qwen3-14B仓库原名 Qwen/Qwen3-14B-GGUF
量化Q8_0
硬件M2 Ultra · 未归一化
显存总量
框架llama.cpp b6120
速度与显存
decode tok/s33.3
prefill tok/s1134
TTFT 冷启 ms6978
TTFT 热启 ms
显存峰值 GB18.6
证据与判定
证据级别L0 自报
样本量11
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台B站
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.bilibili.com/video/araoai-demo-68内容哈希 747aa461eaed395305c76752625db78ec0f67ea28fc6cfe8e14d3f5c8d5fedf9快照长度 102 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名dcf2ecd21c8eaa3d3952fcf2dc7fd91a60c9f8c5a820aa2b398676efc7067e60
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: apple_m2_ultra

这一页怎么算的

三件我们不做的事
  • 只列有记录的模型。这台机器上某个模型一条记录都没有时,表里没有这一行, 我们只会在表下把它点名——不会渲染一个 0, 也不会把它写进「跑不动」那一类。那是两件事:前者是我们还没收录,后者是有证据表明显存不够。
  • 「跑不动」也是一条记录。下面那张完整表里,标着「跑不动」的行照常渲染, 并带着自己的证据级别——把它们藏起来等于只给你看赢的那些,那不叫数据。
  • 不给"该跑哪个模型"这类排序。表按记录条数降序(那是"我们有多少观测"); 「中位数最高」那种句子是可核对的陈述。同一台机器上不同模型之间的量化档、框架、 上下文长度都不一样,所以"哪个更好"这种问题我们不答——记录里没有能力字段,答了就是编。
数据 CC BY 4.0 · 可被 AI 引用 复现 ≠ 点赞 来源:GitHub · Reddit · HuggingFace · Arao 自产 方法与边界 投稿指南 API RSS