跑得动araoai.com
投稿
搜什么 常用 M3 Max × Qwen3-32BRX 7900 GRE · 未归一化 × Llama-3.1-8B-Instruct · 未归一化Qwen2.5-7B-Instruct · 未归一化 × mlx-lmQ4_K_M 72 条 Run · 7 个模型 · 10 个硬件型号
全量数据

每一条实测记录,都能追到来源

这是库里的全部实测记录,不是精选。筛选条件写在网址里,所以你复制出去的链接就是你看到的这一屏。 每条记录都标着证据级别:L0 是自报,L1 被第三方复现过,L2 还跨了框架。 想把几个模型或几张卡摆在一张表上比,用横向对比

重置
证据 全部L1 及以上L2 跨框架 入库时间 近 7 天近 30 天全部 命中 16

实测记录

筛选命中 16 条 · 第 1/1 页 · 本页 16 条 · (库中共 72 条)

模型 / 量化 decodetok/s prefilltok/s TTFTms 显存峰值GB 证据 复现链 状态
Qwen2.5-7B-Instruct · 未归一化AWQ 4-bit Apple M3 Max · 128G 统一内存vLLM 0.6.2知乎最后入库 1 天前n=7 70.5 2466 2421 L0 自报 待复现 待判定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化AWQ 4-bit
硬件Apple M3 Max · 128G 统一内存
显存总量
框架vLLM 0.6.2
速度与显存
decode tok/s70.5
prefill tok/s2466
TTFT 冷启 ms2421
TTFT 热启 ms
显存峰值 GB6.1
证据与判定
证据级别L0 自报
样本量7
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台知乎
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://zhuanlan.zhihu.com/p/araoai-demo-4内容哈希 60d005bd9960ed1e5a9d1197df7f468eb9e22b9e100bdf0ad1ce480de3b46bad快照长度 106 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名1a7de696fb9be50cf2e6941e9361aaf080c9732e74b19a0278b6153b0e7e76e2
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中model: Qwen/Qwen2.5-7B-Instruct-GGUF
Qwen2.5-7B-Instruct · 未归一化Q4_K_M AMD Radeon RX 7900 XTX · 24Gmlx-lm 0.18.2GitHub最后入库 1 天前n=17 138.9 4700 2530 L0 自报 待复现 稳定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q4_K_M
硬件AMD Radeon RX 7900 XTX · 24G
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s138.9
prefill tok/s4700
TTFT 冷启 ms2530
TTFT 热启 ms
显存峰值 GB6.4
证据与判定
证据级别L0 自报
样本量17
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台GitHub
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://github.com/araoai-demo/benchmarks/issues/1014内容哈希 68585eb38414d526d36a2e6a3a30c907b8c34359c521816e7c13111e59881e0c快照长度 105 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名0e7e7ec01b77eb384cabeff5ab96fe0592ca2927ff363a88ea772c1f465eb0a0
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中model: Qwen/Qwen2.5-7B-Instruct-GGUF
Qwen2.5-7B-Instruct · 未归一化Q8_0 RX 7800 XT · 未归一化mlx-lm 0.18.2Reddit最后入库 1 天前n=3 51.0 1725 3879 L0 自报 待复现 待判定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q8_0
硬件RX 7800 XT · 未归一化
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s51.0
prefill tok/s1725
TTFT 冷启 ms3879
TTFT 热启 ms
显存峰值 GB10.1
证据与判定
证据级别L0 自报
样本量3
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台Reddit
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.reddit.com/r/araoai_demo/comments/demo15_qwen2-5-7b-instruct-gguf/内容哈希 1c7f42f1861e01fb5a0d26569e13e24e9f35682ffa4923366f6443d40ec1bb55快照长度 101 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名870d580234a64645be3c7fafe966a0fcd75d9df6097a4adc1ebef5a4fcf824d5
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rx_7800_xt;model: Qwen/Qwen2.5-7B-Instruct-GGUF
Qwen2.5-7B-Instruct · 未归一化AWQ 4-bit AMD Radeon RX 7900 XTX · 24GvLLM 0.6.2HuggingFace最后入库 1 天前n=4 169.3 5919 2421 L0 自报 待复现 待判定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化AWQ 4-bit
硬件AMD Radeon RX 7900 XTX · 24G
显存总量
框架vLLM 0.6.2
速度与显存
decode tok/s169.3
prefill tok/s5919
TTFT 冷启 ms2421
TTFT 热启 ms
显存峰值 GB6.1
证据与判定
证据级别L0 自报
样本量4
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台HuggingFace
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://huggingface.co/araoai-demo/qwen2-5-7b-instruct-gguf-bench/discussions/16内容哈希 dd7004b359107cb0abad1a4e07af345a6ddf2e9f2a2fa925555f65e56e307bbf快照长度 112 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名459b4a8e55dd4b718a39b9d3ef4e6cd4afc39485206cf4e378c4ffd7f584c57f
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中model: Qwen/Qwen2.5-7B-Instruct-GGUF
Qwen2.5-7B-Instruct · 未归一化Q5_K_M RTX 3060 · 未归一化mlx-lm 0.18.2V2EX最后入库 1 天前n=5 44.6 1511 2822 L0 自报 待复现 待判定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q5_K_M
硬件RTX 3060 · 未归一化
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s44.6
prefill tok/s1511
TTFT 冷启 ms2822
TTFT 热启 ms
显存峰值 GB7.2
证据与判定
证据级别L0 自报
样本量5
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台V2EX
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.v2ex.com/t/araoai-demo-17内容哈希 749120eca30bf8df47cd61aff361afe6ba37458c29c9406c1a03c8d7d8189526快照长度 99 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名1dce08f06d3ae4977716159bb9b94ed64195c471328fec5476fe6e90d8634d72
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rtx_3060;model: Qwen/Qwen2.5-7B-Instruct-GGUF
Qwen2.5-7B-Instruct · 未归一化Q4_K_M M2 Ultra · 未归一化ollama 0.5.1知乎最后入库 1 天前n=6 109.8 3673 2530 L0 自报 待复现 待判定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q4_K_M
硬件M2 Ultra · 未归一化
显存总量
框架ollama 0.5.1
速度与显存
decode tok/s109.8
prefill tok/s3673
TTFT 冷启 ms2530
TTFT 热启 ms
显存峰值 GB6.4
证据与判定
证据级别L0 自报
样本量6
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台知乎
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://zhuanlan.zhihu.com/p/araoai-demo-18内容哈希 5fe2fcda65165778b8e3e643761d435cc64e96c4ee177644a4b2833400289305快照长度 109 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名e3fae782b34f915b8d6977a371d1b49ec73ae9a11362ba511018091193e4d0df
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: apple_m2_ultra;model: Qwen/Qwen2.5-7B-Instruct-GGUF
Qwen2.5-7B-Instruct · 未归一化FP16 M2 Ultra · 未归一化mlx-lm 0.18.2HuggingFace最后入库 1 天前n=11 34.7 1175 6613 L0 自报 待复现 稳定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化FP16
硬件M2 Ultra · 未归一化
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s34.7
prefill tok/s1175
TTFT 冷启 ms6613
TTFT 热启 ms
显存峰值 GB17.6
证据与判定
证据级别L0 自报
样本量11
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台HuggingFace
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://huggingface.co/araoai-demo/qwen2-5-7b-instruct-gguf-bench/discussions/23内容哈希 b07b7486f883f6497d8e2e2d6327eeb55fc5b3a32683c8fafe16e37244db4898快照长度 110 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名94e8f9ff6c38c0b87b76605ee4993ceefc26bc9eb6a2537c3bdbf859c2004bb9
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: apple_m2_ultra;model: Qwen/Qwen2.5-7B-Instruct-GGUF
Qwen2.5-7B-Instruct · 未归一化AWQ 4-bit RTX 4080 SUPER · 未归一化mlx-lm 0.18.2B站最后入库 1 天前n=14 113.6 3843 2421 L0 自报 待复现 稳定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化AWQ 4-bit
硬件RTX 4080 SUPER · 未归一化
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s113.6
prefill tok/s3843
TTFT 冷启 ms2421
TTFT 热启 ms
显存峰值 GB6.1
证据与判定
证据级别L0 自报
样本量14
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台B站
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.bilibili.com/video/araoai-demo-26内容哈希 dd3a49fc26bcfe47f51a4bb5e49a27de94004d1c23785294b48664d26a887cee快照长度 112 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名385f913dd2135076d79fa9362bf0f8034ed117dea1214f37b79f27ecee633f7d
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rtx_4080_super;model: Qwen/Qwen2.5-7B-Instruct-GGUF
Qwen2.5-7B-Instruct · 未归一化Q6_K M2 Ultra · 未归一化ExLlamaV2 0.2.5Arao 自产最后入库 1 天前n=15 91.0 3139 3186 L0 自报 待复现 稳定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q6_K
硬件M2 Ultra · 未归一化
显存总量
框架ExLlamaV2 0.2.5
速度与显存
decode tok/s91.0
prefill tok/s3139
TTFT 冷启 ms3186
TTFT 热启 ms
显存峰值 GB8.2
证据与判定
证据级别L0 自报
样本量15
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方Arao 实测
复现链待复现
原始来源
平台Arao 自产
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://araoai.com/demo/rig-run-27内容哈希 14315352e0b51fb5cd03764f76d82d90d8a590460c9da147c59f692a616ede9c快照长度 108 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名9fc83d347256c63684f4e0b2c317213924a1e4e1197a04824506d2c773863033
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: apple_m2_ultra;model: Qwen/Qwen2.5-7B-Instruct-GGUF;quant: Q6_K
Qwen2.5-7B-Instruct · 未归一化Q5_K_M Apple M3 Max · 128G 统一内存ollama 0.5.1GitHub最后入库 1 天前n=8 47.1 1574 2822 L0 自报 待复现 稳定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q5_K_M
硬件Apple M3 Max · 128G 统一内存
显存总量
框架ollama 0.5.1
速度与显存
decode tok/s47.1
prefill tok/s1574
TTFT 冷启 ms2822
TTFT 热启 ms
显存峰值 GB7.2
证据与判定
证据级别L0 自报
样本量8
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台GitHub
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://github.com/araoai-demo/benchmarks/issues/1035内容哈希 c7cc3d6a505e3c0a3fab999bc021cd1a30c9a62628bcd196c820bc325adde978快照长度 107 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名17e6f85f327bf96fc56441c41bbbdb40d4afc95da70de74119e68a5fe3bd6c20
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中model: Qwen/Qwen2.5-7B-Instruct-GGUF
Qwen2.5-7B-Instruct · 未归一化Q8_0 NVIDIA RTX 3090 · 24Gllama.cpp b6120Arao 自产最后入库 1 天前n=14 78.0 2653 3879 L0 自报 待复现 稳定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q8_0
硬件NVIDIA RTX 3090 · 24G
显存总量
框架llama.cpp b6120
速度与显存
decode tok/s78.0
prefill tok/s2653
TTFT 冷启 ms3879
TTFT 热启 ms
显存峰值 GB10.1
证据与判定
证据级别L0 自报
样本量14
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方Arao 实测
复现链待复现
原始来源
平台Arao 自产
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://araoai.com/demo/rig-run-41内容哈希 cc93763512eabc7df3236625adb6b7403582e6a51284cf9dba8fa104d9d4e759快照长度 102 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名5e60e7c1ec07f1c2547dba6e96415cd39775a5eb88e9bee2be76ce3c22f1dcdc
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中model: Qwen/Qwen2.5-7B-Instruct-GGUF
Qwen2.5-7B-Instruct · 未归一化Q4_K_M Arc A770 · 未归一化ExLlamaV2 0.2.5GitHub最后入库 1 天前n=15 87.6 3021 2530 L0 自报 待复现 稳定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q4_K_M
硬件Arc A770 · 未归一化
显存总量
框架ExLlamaV2 0.2.5
速度与显存
decode tok/s87.6
prefill tok/s3021
TTFT 冷启 ms2530
TTFT 热启 ms
显存峰值 GB6.4
证据与判定
证据级别L0 自报
样本量15
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台GitHub
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://github.com/araoai-demo/benchmarks/issues/1042内容哈希 548eecb28d83ab636b49cd7a68766126da5168883b695ee6137c51c275d7ea6e快照长度 106 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名175880dc481eb8f0a8ae47b8f9fea2046591cbf98bb52ed4e7f7180751a30907
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: arc_a770;model: Qwen/Qwen2.5-7B-Instruct-GGUF
Qwen2.5-7B-Instruct · 未归一化AWQ 4-bit NVIDIA RTX 4090 · 24Gmlx-lm 0.18.2HuggingFace最后入库 1 天前n=17 155.5 5264 2421 L0 自报 待复现 稳定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化AWQ 4-bit
硬件NVIDIA RTX 4090 · 24G
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s155.5
prefill tok/s5264
TTFT 冷启 ms2421
TTFT 热启 ms
显存峰值 GB6.1
证据与判定
证据级别L0 自报
样本量17
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台HuggingFace
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://huggingface.co/araoai-demo/qwen2-5-7b-instruct-gguf-bench/discussions/44内容哈希 787c9af8f9ea012dc78d8ab407c7ce11ee280dd5146115d7e0c24779ca7bb073快照长度 109 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名eae27c47fcf149c7216f486babd50b943910bf7ae80b6bc1aa68771d8892a8d2
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中model: Qwen/Qwen2.5-7B-Instruct-GGUF
Qwen2.5-7B-Instruct · 未归一化Q6_K NVIDIA RTX 3090 · 24Gollama 0.5.1V2EX最后入库 1 天前n=3 93.5 3125 3186 L0 自报 待复现 待判定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q6_K
硬件NVIDIA RTX 3090 · 24G
显存总量
框架ollama 0.5.1
速度与显存
decode tok/s93.5
prefill tok/s3125
TTFT 冷启 ms3186
TTFT 热启 ms
显存峰值 GB8.2
证据与判定
证据级别L0 自报
样本量3
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台V2EX
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.v2ex.com/t/araoai-demo-45内容哈希 2f8e3ff560e223b46aae7d3ca24049a7326e5d563f9cb11e3c06892b90ca92b7快照长度 99 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名332331f90bc415d1caed175dd98a4d390fb5d70848419b59cd1308fd1520b324
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中model: Qwen/Qwen2.5-7B-Instruct-GGUF;quant: Q6_K
Qwen2.5-7B-Instruct · 未归一化AWQ 4-bit RTX 3060 · 未归一化mlx-lm 0.18.2知乎最后入库 1 天前n=11 55.6 1880 2421 L0 自报 待复现 稳定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化AWQ 4-bit
硬件RTX 3060 · 未归一化
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s55.6
prefill tok/s1880
TTFT 冷启 ms2421
TTFT 热启 ms
显存峰值 GB6.1
证据与判定
证据级别L0 自报
样本量11
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台知乎
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://zhuanlan.zhihu.com/p/araoai-demo-53内容哈希 0e6053f669956974dda71341f4e9c48fcb467569484086d9e71fbf8002e238d3快照长度 102 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名287684476b2eb094864024dd20ca52807ac2f3d1bb4a407ea725e6928a20b3db
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rtx_3060;model: Qwen/Qwen2.5-7B-Instruct-GGUF
Qwen2.5-7B-Instruct · 未归一化AWQ 4-bit RX 7900 GRE · 未归一化ExLlamaV2 0.2.5Arao 自产最后入库 1 天前n=5 96.1 3315 2421 L0 自报 待复现 待判定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化AWQ 4-bit
硬件RX 7900 GRE · 未归一化
显存总量
框架ExLlamaV2 0.2.5
速度与显存
decode tok/s96.1
prefill tok/s3315
TTFT 冷启 ms2421
TTFT 热启 ms
显存峰值 GB6.1
证据与判定
证据级别L0 自报
样本量5
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方Arao 实测
复现链待复现
原始来源
平台Arao 自产
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://araoai.com/demo/rig-run-62内容哈希 3a771ac4b5cf3f32ac02b0a97bccfe93c5ee2516c97bdeed1fba31c635334e20快照长度 109 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名28de22e7f4f4601f1df49a46aee821cfa6e9d4327e96a8cd37dac52906147e05
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rx_7900_gre;model: Qwen/Qwen2.5-7B-Instruct-GGUF
导出 CSV JSON 导出当前筛选的全部命中结果(上限 500 条)

按模型看 · 按硬件看

每个取值一页

点一个取值进去,就是它自己的页面:中位吞吐、区间、样本量与证据级别, 以及我们没有收录的组合——缺的那些写清楚是缺,不补数字。下面只列有记录的取值; 没有记录的不在这里,因为我们没有东西可说。

怎么读这张表

  • 证据级别不是我们自己打的标签。它由记录之间的相互验证推导:同一三元组被第三方用不同框架 跑出接近的数字,才升到 L1;跨框架也对得上,才是 L2。Arao 自产的记录即使带签名,在别人复现之前 仍然是 L0。
  • 没有样本量的数字不显示。一行就是一个样本集,四个指标同源;样本量缺失时整行数字渲染 ,因为一个没有 n 的统计值不该被当成结论。
  • 「跑不动」和「没有数据」是两回事。前者是有证据表明显存不够,后者是我们还没收录这个组合 ——把后者读成前者,就是拿机器的沉默冒充人的结论。
  • 导出的上限是服务端强制的。当前视图最多导出 500 行;程序化取全量请走 API
数据 CC BY 4.0 · 可被 AI 引用 复现 ≠ 点赞 来源:GitHub · Reddit · HuggingFace · Arao 自产 方法与边界 投稿指南 API RSS