跑得动araoai.com
投稿
搜什么 常用 M3 Max × Qwen3-32BRX 7900 GRE · 未归一化 × Llama-3.1-8B-Instruct · 未归一化Qwen2.5-7B-Instruct · 未归一化 × mlx-lmQ4_K_M 72 条 Run · 7 个模型 · 10 个硬件型号
横向对比

把几个配置,摆在一张表上

两种问法:同一个模型在哪张卡上更快,和同一台机器上哪个框架更快。 表里每一列是一个对比项,每一行是一个指标,数字是中位数,后面跟着支撑它的样本量。 结论只对我们库里这些记录成立——跨硬件不可比,这里做的是数量级参考,不是横评。

先选比什么

最多 6 个对比项

两种模式问的是两件不同的事:同一个模型在哪张卡上更快, 和同一台机器上哪个后端更快。换模式等于换一个问题,基准与对比项都不沿用。

先说结论

在当前记录里 ExLlamaV2 的 decode 中位数最高(56.1 tok/s,n=22,证据 L1 已复现)—— 次高是 mlx-lm(43.0 tok/s,n=41,证据 L0 自报)。

同一台机器上不同框架的默认参数、batch size 与版本都可能不同——这里比的是记录,不是框架本身。

下面这组是默认示例(记录最多的两项)——是我们替你挑的,不是你的选择; 用上面的选择器换一组,或用链接把它固化到网址里。

能不能放在一起看

逐项核对 6 项 · 另有 1 项是你选来对比的

判据是这 7 项:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数;你选来对比的那一维(框架(含版本))本来就不一样,所以不计入差异数。门槛(写在这里,你可以自己核对):0 维不同 → 可直接比较;1–2 维不同 → 方向性可比;≥3 维不同 → 不可比。「未核对」不是「一致」:只有一侧有值、或某一列的记录没全登记,一律不给绿灯;双方都没有值的维度会单独点名,也不算一致。门槛要求至少 1 项确认一致,所以"什么都不知道"也不会是绿灯。

🟡 方向性可比

不建议直接比较:有 2 项不同 —— 模型(Qwen3-14B / Llama-3.1-8B-Instruct · 未归一化 vs Qwen2.5-7B-Instruct · 未归一化 / phi-4 · 未归一化 / Mistral-Nemo-Instruct-2407 · 未归一化)、量化(AWQ 4-bit / Q4_K_M / Q8_0 vs AWQ 4-bit / Q4_K_M)。3 项双方都没有值上下文长度batch并发数)—— 它们是「未核对」,不是「一致」。把它们摆在一张表上只能当数量级参考,差额不能算到你想比的那一维头上。

这是两道独立的闸:上面那一道问「能不能排序」(样本量与证据级别够不够), 这一道问「能不能放在一起看」(条件是否一致)。两个都过,这几个数字才谈得上可比。

逐项核对
模型不同 Qwen3-14B / Llama-3.1-8B-Instruct · 未归一化 vs Qwen2.5-7B-Instruct · 未归一化 / phi-4 · 未归一化 / Mistral-Nemo-Instruct-2407 · 未归一化
量化不同 AWQ 4-bit / Q4_K_M / Q8_0 vs AWQ 4-bit / Q4_K_M
框架(含版本)不同 mlx-lm 0.18.2 vs ExLlamaV2 0.2.5(这一维是你选的对比维度)
上下文长度未核对 双方都没有值 —— 未核对,不是一致
硬件一致 RX 7900 GRE · 未归一化 vs RX 7900 GRE · 未归一化
batch未核对 双方都没有值 —— 未核对,不是一致
并发数未核对 双方都没有值 —— 未核对,不是一致
对比项(框架)· 最多 6 个

点一下加入对比,再点一下移出。括号里的数字是点下去会得到几条记录 (所以 0 意味着这个组合我们还没收录,不是它跑不了)。

横向对比 · 同一硬件 × 多框架

基准:RX 7900 GRE · 未归一化 · 2 个对比项 · 默认示例

四个指标都取中位数,而且只统计有有效样本量的记录 (没有 n 的记录在任何一格都不参与)。decode 与 prefill 越高越快,TTFT 与显存峰值越低越好。 每一格后面的小字是支撑这个数字的样本量;最下面两行是整列的证据级别与样本量合计。 排序结论只对「我们库里这些记录」成立,不构成对硬件或框架能力的判断。

同一台机器(RX 7900 GRE · 未归一化)上不同框架的 decode 中位数
指标mlx-lm · 4 条记录ExLlamaV2 · 3 条记录
decode越高越好 43.0tok/sn=41 56.1tok/sn=22
prefill越高越好 1457tok/sn=41 1934tok/sn=22
TTFT 冷启越低越好 4171msn=41 3592msn=22
显存峰值越低越好 10.9GBn=41 9.3GBn=22
证据 L0 自报 L1 已复现
n整列样本量合计 41 22
参与这次对比的全部记录7 条记录 · 含跑不通的

参与这次对比的全部记录

7 条 · 最快的排前面

本次对比涉及的记录一条不落,每条都带证据级别与样本量,展开可以看到完整字段。

模型 / 量化 decodetok/s prefilltok/s TTFTms 显存峰值GB 证据 复现链 状态
Qwen2.5-7B-Instruct · 未归一化AWQ 4-bit ExLlamaV2 0.2.5Arao 自产最后入库 1 天前n=5 96.1 3315 2421 L0 自报 待复现 待判定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化AWQ 4-bit
硬件RX 7900 GRE · 未归一化
显存总量
框架ExLlamaV2 0.2.5
速度与显存
decode tok/s96.1
prefill tok/s3315
TTFT 冷启 ms2421
TTFT 热启 ms
显存峰值 GB6.1
证据与判定
证据级别L0 自报
样本量5
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方Arao 实测
复现链待复现
原始来源
平台Arao 自产
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://araoai.com/demo/rig-run-62内容哈希 3a771ac4b5cf3f32ac02b0a97bccfe93c5ee2516c97bdeed1fba31c635334e20快照长度 109 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名28de22e7f4f4601f1df49a46aee821cfa6e9d4327e96a8cd37dac52906147e05
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rx_7900_gre;model: Qwen/Qwen2.5-7B-Instruct-GGUF
Llama-3.1-8B-Instruct · 未归一化AWQ 4-bit mlx-lm 0.18.2V2EX最后入库 1 天前n=17 77.8 2632 2655 L0 自报 待复现 稳定
模型与硬件
模型Llama-3.1-8B-Instruct · 未归一化仓库原名 meta-llama/Llama-3.1-8B-Instruct
量化AWQ 4-bit
硬件RX 7900 GRE · 未归一化
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s77.8
prefill tok/s2632
TTFT 冷启 ms2655
TTFT 热启 ms
显存峰值 GB6.7
证据与判定
证据级别L0 自报
样本量17
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台V2EX
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.v2ex.com/t/araoai-demo-59内容哈希 4d0bd5dd22b4397ecae0529099cfca76f83a50f10a2caf499d102fe190c25c96快照长度 107 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名0ede28561ef9b98d9cb71c80976b501af4502929ec04ef7022574d02b8b54806
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rx_7900_gre;model: meta-llama/Llama-3.1-8B-Instruct
Mistral-Nemo-Instruct-2407 · 未归一化AWQ 4-bit ExLlamaV2 0.2.5B站最后入库 1 天前n=7 56.1 1934 3592 L1 已复现 1 次 待判定
模型与硬件
模型Mistral-Nemo-Instruct-2407 · 未归一化仓库原名 mistralai/Mistral-Nemo-Instruct-2407
量化AWQ 4-bit
硬件RX 7900 GRE · 未归一化
显存总量
框架ExLlamaV2 0.2.5
速度与显存
decode tok/s56.1
prefill tok/s1934
TTFT 冷启 ms3592
TTFT 热启 ms
显存峰值 GB9.3
证据与判定
证据级别L1 已复现 1 次
样本量7
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数1
测量方第三方实测
复现链
原始来源
平台B站
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.bilibili.com/video/araoai-demo-19内容哈希 c8d01e539905226f362f044339ec311ced35f1c4ab1aee3ed2d8f6a969932feb快照长度 120 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名73b54419a1924b187dad61cc6a51bdcf89a6fd32b783e10bb0526dda868de6b5
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rx_7900_gre;model: mistralai/Mistral-Nemo-Instruct-2407
phi-4 · 未归一化Q4_K_M ExLlamaV2 0.2.5GitHub最后入库 1 天前n=10 45.1 1554 4280 L0 自报 待复现 稳定
模型与硬件
模型phi-4 · 未归一化仓库原名 microsoft/phi-4-GGUF
量化Q4_K_M
硬件RX 7900 GRE · 未归一化
显存总量
框架ExLlamaV2 0.2.5
速度与显存
decode tok/s45.1
prefill tok/s1554
TTFT 冷启 ms4280
TTFT 热启 ms
显存峰值 GB11.2
证据与判定
证据级别L0 自报
样本量10
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台GitHub
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://github.com/araoai-demo/benchmarks/issues/1007内容哈希 985fffc75c709be230923d65ed466d222c60d67174e5a09d11f0c13731937736快照长度 100 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名f3785e3d27e5c1db3879fa9036c28fa756637127238fb51bd4e7e8424150f92e
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rx_7900_gre;model: microsoft/phi-4-GGUF
Qwen3-14BAWQ 4-bit mlx-lm 0.18.2Reddit最后入库 1 天前n=8 44.4 1504 4061 L0 自报 待复现 稳定
模型与硬件
模型Qwen3-14B仓库原名 Qwen/Qwen3-14B-GGUF
量化AWQ 4-bit
硬件RX 7900 GRE · 未归一化
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s44.4
prefill tok/s1504
TTFT 冷启 ms4061
TTFT 热启 ms
显存峰值 GB10.6
证据与判定
证据级别L0 自报
样本量8
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台Reddit
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.reddit.com/r/araoai_demo/comments/demo50_qwen3-14b-gguf/内容哈希 9cbe1e2594572e05305fcabee9820cb024b24ebb7ef783ef817de730cf8e7342快照长度 96 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名547e590cc6d4c005ef0af9c4d1c308dc2013bfbd07d4c455bbd3b9f7084978ce
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rx_7900_gre
Qwen3-14BQ4_K_M mlx-lm 0.18.2GitHub最后入库 1 天前n=7 41.7 1410 4280 L0 自报 待复现 待判定
模型与硬件
模型Qwen3-14B仓库原名 Qwen/Qwen3-14B-GGUF
量化Q4_K_M
硬件RX 7900 GRE · 未归一化
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s41.7
prefill tok/s1410
TTFT 冷启 ms4280
TTFT 热启 ms
显存峰值 GB11.2
证据与判定
证据级别L0 自报
样本量7
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台GitHub
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://github.com/araoai-demo/benchmarks/issues/1049内容哈希 1704504f701d191f7d18e823cc906bd1cece4cd8f4b5c6101ce1b305a49bb8d1快照长度 94 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名80684a4188cc8b6cbbbdd266e26ffb1abadd9c4240b0f40bcc3b4a63520d5e2e
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rx_7900_gre
Llama-3.1-8B-Instruct · 未归一化Q8_0 mlx-lm 0.18.2V2EX最后入库 1 天前n=9 41.2 1393 4322 L0 自报 待复现 稳定
模型与硬件
模型Llama-3.1-8B-Instruct · 未归一化仓库原名 meta-llama/Llama-3.1-8B-Instruct
量化Q8_0
硬件RX 7900 GRE · 未归一化
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s41.2
prefill tok/s1393
TTFT 冷启 ms4322
TTFT 热启 ms
显存峰值 GB11.3
证据与判定
证据级别L0 自报
样本量9
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台V2EX
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.v2ex.com/t/araoai-demo-66内容哈希 eb04af7fe0acbc6eb8ff9ffac17aaae4cd7037175e3a8e702ffff6312e96568e快照长度 103 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名6e4687630cb407a876b228d240fa8ddac39926667975d0c5bedc26b3e93eb864
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rx_7900_gre;model: meta-llama/Llama-3.1-8B-Instruct
这一页怎么比的为什么用中位数 · 排序为什么要两道闸 · 为什么不给排序下强结论 · 上限是多少

这一页怎么比的

  • 四个指标都取中位数,而且只统计有有效样本量的记录。中位数对个别离群值不敏感; 没有样本量的记录在任何一格都不参与——一个没有 n 的统计值和编出来的数字没有区别。 每一格后面的小字就是支撑它的样本量。
  • 排序只看 decode 中位数,而且有两道闸。要给出「谁的 decode 中位数最高」这句话, 最高那一项必须至少 n≥3、证据级别至少 L1。单次观测排不出高低, 自报数字排出来的顺序也不构成可比性。任何一条不满足,这一页就直接说 「这些记录不足以支撑一个排序结论」——不硬指定谁更高
  • 这里不给排序下强结论。跨硬件不可比,只做数量级参考:不同厂商、不同后端、 不同 batch size 的数字放在一张表里,能回答的是「差几倍」,不是「谁更强」。 买哪张卡、用哪个框架,还要看你的预算、你的模型和你的耐心——那些都不在这张表里。
  • 对比项有数量上限。超过上限的网址会被拒绝(返回 400 页并说明超了几个), 而不是悄悄丢掉多余的项——那种"看起来筛了、其实没筛"的失败最难发现。 上限写在页面上方的模式切换那一块里,数字取自代码里的同一个常量。
  • 每个对比项都能点进去。列头是链接,指向数据页里筛好的那份记录; 页尾折叠体里是本次对比涉及的全部记录,每条都带证据级别、样本量与原始来源。
数据 CC BY 4.0 · 可被 AI 引用 复现 ≠ 点赞 来源:GitHub · Reddit · HuggingFace · Arao 自产 方法与边界 投稿指南 API RSS