跑得动araoai.com
投稿
搜什么 常用 M3 Max × Qwen3-32BRX 7900 GRE · 未归一化 × Llama-3.1-8B-Instruct · 未归一化Qwen2.5-7B-Instruct · 未归一化 × mlx-lmQ4_K_M 72 条 Run · 7 个模型 · 10 个硬件型号
全量数据

每一条实测记录,都能追到来源

这是库里的全部实测记录,不是精选。筛选条件写在网址里,所以你复制出去的链接就是你看到的这一屏。 每条记录都标着证据级别:L0 是自报,L1 被第三方复现过,L2 还跨了框架。 想把几个模型或几张卡摆在一张表上比,用横向对比

重置
证据 全部L1 及以上L2 跨框架 入库时间 近 7 天近 30 天全部 命中 22

实测记录

筛选命中 22 条 · 第 1/1 页 · 本页 22 条 · (库中共 72 条)

模型 / 量化 decodetok/s prefilltok/s TTFTms 显存峰值GB 证据 复现链 状态
DeepSeek-R1-Distill-Qwen-14B · 未归一化Q4_K_M RTX 3060 · 未归一化ExLlamaV2 0.2.5V2EX最后入库 1 天前n=6 28.2 971 4280 L0 自报 待复现 待判定
模型与硬件
模型DeepSeek-R1-Distill-Qwen-14B · 未归一化仓库原名 deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
量化Q4_K_M
硬件RTX 3060 · 未归一化
显存总量
框架ExLlamaV2 0.2.5
速度与显存
decode tok/s28.2
prefill tok/s971
TTFT 冷启 ms4280
TTFT 热启 ms
显存峰值 GB11.2
证据与判定
证据级别L0 自报
样本量6
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台V2EX
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.v2ex.com/t/araoai-demo-3内容哈希 c0cd4834d3c0451afb4df85b4f91035a14be872d6d2d2ced80221733ccb79530快照长度 115 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名d290bbf297d934829b28a3863e97a89f4031890ad54ff9d8fd8eb729e0270cd8
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rtx_3060;model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
phi-4 · 未归一化Q4_K_M RX 7900 GRE · 未归一化ExLlamaV2 0.2.5GitHub最后入库 1 天前n=10 45.1 1554 4280 L0 自报 待复现 稳定
模型与硬件
模型phi-4 · 未归一化仓库原名 microsoft/phi-4-GGUF
量化Q4_K_M
硬件RX 7900 GRE · 未归一化
显存总量
框架ExLlamaV2 0.2.5
速度与显存
decode tok/s45.1
prefill tok/s1554
TTFT 冷启 ms4280
TTFT 热启 ms
显存峰值 GB11.2
证据与判定
证据级别L0 自报
样本量10
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台GitHub
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://github.com/araoai-demo/benchmarks/issues/1007内容哈希 985fffc75c709be230923d65ed466d222c60d67174e5a09d11f0c13731937736快照长度 100 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名f3785e3d27e5c1db3879fa9036c28fa756637127238fb51bd4e7e8424150f92e
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rx_7900_gre;model: microsoft/phi-4-GGUF
Mistral-Nemo-Instruct-2407 · 未归一化Q4_K_M M2 Ultra · 未归一化ExLlamaV2 0.2.5知乎最后入库 1 天前n=14 73.0 2518 3780 L0 自报 待复现 稳定
模型与硬件
模型Mistral-Nemo-Instruct-2407 · 未归一化仓库原名 mistralai/Mistral-Nemo-Instruct-2407
量化Q4_K_M
硬件M2 Ultra · 未归一化
显存总量
框架ExLlamaV2 0.2.5
速度与显存
decode tok/s73.0
prefill tok/s2518
TTFT 冷启 ms3780
TTFT 热启 ms
显存峰值 GB9.8
证据与判定
证据级别L0 自报
样本量14
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台知乎
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://zhuanlan.zhihu.com/p/araoai-demo-11内容哈希 78a8d6cdcd874ae93a5b48048096cb19437ba5012a7134802f331d9a5b998757快照长度 118 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名482e4c48a4d56aa1cbdf96aac65c89a6e3d0717105f5690d0bfabc09cece89db
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: apple_m2_ultra;model: mistralai/Mistral-Nemo-Instruct-2407
phi-4 · 未归一化Q4_K_M NVIDIA RTX 3090 · 24GExLlamaV2 0.2.5B站最后入库 1 天前n=15 73.2 2525 4280 L0 自报 待复现 稳定
模型与硬件
模型phi-4 · 未归一化仓库原名 microsoft/phi-4-GGUF
量化Q4_K_M
硬件NVIDIA RTX 3090 · 24G
显存总量
框架ExLlamaV2 0.2.5
速度与显存
decode tok/s73.2
prefill tok/s2525
TTFT 冷启 ms4280
TTFT 热启 ms
显存峰值 GB11.2
证据与判定
证据级别L0 自报
样本量15
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台B站
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.bilibili.com/video/araoai-demo-12内容哈希 25d746232ae30b0d8a4809ee6d3af513f2ca9a2bd4b295bf1b632cd86578b4ef快照长度 99 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名45e1329cf19f0a81ce443d43b61bbff63a687b4da0224155bcb23453b4c88766
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中model: microsoft/phi-4-GGUF
Qwen3-32BQ4_K_M Apple M3 Max · 128G 统一内存llama.cpp b6120Arao 自产最后入库 1 天前n=16 12.9 439 8780 L0 自报 待复现 稳定
模型与硬件
模型Qwen3-32B仓库原名 Qwen/Qwen3-32B-GGUF
量化Q4_K_M
硬件Apple M3 Max · 128G 统一内存
显存总量
框架llama.cpp b6120
速度与显存
decode tok/s12.9
prefill tok/s439
TTFT 冷启 ms8780
TTFT 热启 ms
显存峰值 GB23.5
证据与判定
证据级别L0 自报
样本量16
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方Arao 实测
复现链待复现
原始来源
平台Arao 自产
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://araoai.com/demo/rig-run-13内容哈希 9612fc08f49fc9c539e049eb6d17e7fb88f0a099cec67c48404b51e3027b3c0c快照长度 98 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名379c3b8d39020e50dce9f3a55895f19d01459e727e2071e33adc2503e8e8a652
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中
Qwen2.5-7B-Instruct · 未归一化Q4_K_M AMD Radeon RX 7900 XTX · 24Gmlx-lm 0.18.2GitHub最后入库 1 天前n=17 138.9 4700 2530 L0 自报 待复现 稳定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q4_K_M
硬件AMD Radeon RX 7900 XTX · 24G
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s138.9
prefill tok/s4700
TTFT 冷启 ms2530
TTFT 热启 ms
显存峰值 GB6.4
证据与判定
证据级别L0 自报
样本量17
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台GitHub
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://github.com/araoai-demo/benchmarks/issues/1014内容哈希 68585eb38414d526d36a2e6a3a30c907b8c34359c521816e7c13111e59881e0c快照长度 105 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名0e7e7ec01b77eb384cabeff5ab96fe0592ca2927ff363a88ea772c1f465eb0a0
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中model: Qwen/Qwen2.5-7B-Instruct-GGUF
Qwen2.5-7B-Instruct · 未归一化Q4_K_M M2 Ultra · 未归一化ollama 0.5.1知乎最后入库 1 天前n=6 109.8 3673 2530 L0 自报 待复现 待判定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q4_K_M
硬件M2 Ultra · 未归一化
显存总量
框架ollama 0.5.1
速度与显存
decode tok/s109.8
prefill tok/s3673
TTFT 冷启 ms2530
TTFT 热启 ms
显存峰值 GB6.4
证据与判定
证据级别L0 自报
样本量6
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台知乎
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://zhuanlan.zhihu.com/p/araoai-demo-18内容哈希 5fe2fcda65165778b8e3e643761d435cc64e96c4ee177644a4b2833400289305快照长度 109 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名e3fae782b34f915b8d6977a371d1b49ec73ae9a11362ba511018091193e4d0df
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: apple_m2_ultra;model: Qwen/Qwen2.5-7B-Instruct-GGUF
Qwen3-14BQ4_K_M RTX 4080 SUPER · 未归一化mlx-lm 0.18.2Reddit最后入库 1 天前n=10 53.2 1802 4280 L0 自报 待复现 稳定
模型与硬件
模型Qwen3-14B仓库原名 Qwen/Qwen3-14B-GGUF
量化Q4_K_M
硬件RTX 4080 SUPER · 未归一化
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s53.2
prefill tok/s1802
TTFT 冷启 ms4280
TTFT 热启 ms
显存峰值 GB11.2
证据与判定
证据级别L0 自报
样本量10
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台Reddit
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.reddit.com/r/araoai_demo/comments/demo22_qwen3-14b-gguf/内容哈希 89d727e92c32437b608a36cda5f48d1cf6e8d2000026ee54ec4fe49da9e12372快照长度 97 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名ba3e19a5f050345b9d3f2fe003cad2cd4152a4d8cfe6abb180377ba69209af17
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rtx_4080_super
Llama-3.1-8B-Instruct · 未归一化Q4_K_M RX 7800 XT · 未归一化ExLlamaV2 0.2.5GitHub最后入库 1 天前n=16 85.4 2946 2780 L2 跨框架已验证 稳定
模型与硬件
模型Llama-3.1-8B-Instruct · 未归一化仓库原名 meta-llama/Llama-3.1-8B-Instruct
量化Q4_K_M
硬件RX 7800 XT · 未归一化
显存总量
框架ExLlamaV2 0.2.5
速度与显存
decode tok/s85.4
prefill tok/s2946
TTFT 冷启 ms2780
TTFT 热启 ms
显存峰值 GB7.1
证据与判定
证据级别L2 跨框架已验证
样本量16
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数3
测量方第三方实测
复现链
原始来源
平台GitHub
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://github.com/araoai-demo/benchmarks/issues/1028内容哈希 ce3579e8e42587b887786363f1b07926648b89353d02c090da467ef3557b06ef快照长度 111 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名32c2b8d6e58ee592f9fb76b6d56125d538379db9f604ff3a5ef29246b6358685
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rx_7800_xt;model: meta-llama/Llama-3.1-8B-Instruct
Llama-3.1-8B-Instruct · 未归一化Q4_K_M RX 7800 XT · 未归一化mlx-lm 0.18.2Reddit最后入库 1 天前n=17 79.0 2673 2780 L2 跨框架已验证 稳定
模型与硬件
模型Llama-3.1-8B-Instruct · 未归一化仓库原名 meta-llama/Llama-3.1-8B-Instruct
量化Q4_K_M
硬件RX 7800 XT · 未归一化
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s79.0
prefill tok/s2673
TTFT 冷启 ms2780
TTFT 热启 ms
显存峰值 GB7.1
证据与判定
证据级别L2 跨框架已验证
样本量17
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数2
测量方第三方实测
复现链
原始来源
平台Reddit
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.reddit.com/r/araoai_demo/comments/demo2900_llama-3-1-8b-instruct/内容哈希 32f1e4081cdfcabc83fae48962d208dd5436c5e75996ef6b866e10020c31219c快照长度 106 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名af6222c6ef6ddc4dc3f66135f6f8efc0e0ff11c5236bc7f7604757e0521217a4
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rx_7800_xt;model: meta-llama/Llama-3.1-8B-Instruct
DeepSeek-R1-Distill-Qwen-14B · 未归一化Q4_K_M Arc A770 · 未归一化llama.cpp b5980HuggingFace最后入库 1 天前n=3 39.7 1336 4280 L0 自报 待复现 待判定
模型与硬件
模型DeepSeek-R1-Distill-Qwen-14B · 未归一化仓库原名 deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
量化Q4_K_M
硬件Arc A770 · 未归一化
显存总量
框架llama.cpp b5980
速度与显存
decode tok/s39.7
prefill tok/s1336
TTFT 冷启 ms4280
TTFT 热启 ms
显存峰值 GB11.2
证据与判定
证据级别L0 自报
样本量3
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台HuggingFace
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://huggingface.co/araoai-demo/deepseek-r1-distill-qwen-14b-bench/discussions/30内容哈希 f915c9ecfe24007d219fa7a4a25eb5bef841b5c308140d694635a306c468bb7e快照长度 122 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名02a91232c61d97aa0319230c34e2386c67066ab8f274e18304f1812f942439a9
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: arc_a770;model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
Mistral-Nemo-Instruct-2407 · 未归一化Q4_K_M NVIDIA RTX 4090 · 24Gollama 0.5.1知乎最后入库 1 天前n=5 80.7 2699 3780 L0 自报 待复现 待判定
模型与硬件
模型Mistral-Nemo-Instruct-2407 · 未归一化仓库原名 mistralai/Mistral-Nemo-Instruct-2407
量化Q4_K_M
硬件NVIDIA RTX 4090 · 24G
显存总量
框架ollama 0.5.1
速度与显存
decode tok/s80.7
prefill tok/s2699
TTFT 冷启 ms3780
TTFT 热启 ms
显存峰值 GB9.8
证据与判定
证据级别L0 自报
样本量5
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台知乎
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://zhuanlan.zhihu.com/p/araoai-demo-32内容哈希 0362a62478ce989ec777c68548760f0e4f6c2ae48d636b12af3f58190a3346be快照长度 109 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名691513789e69d1cc7293857f83c9ca8923520180ba7b7c56dbac05a76fd1fe9a
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中model: mistralai/Mistral-Nemo-Instruct-2407
DeepSeek-R1-Distill-Qwen-14B · 未归一化Q4_K_M NVIDIA RTX 3090 · 24Gllama.cpp b5980Arao 自产最后入库 1 天前n=7 66.3 2234 4280 L0 自报 待复现 待判定
模型与硬件
模型DeepSeek-R1-Distill-Qwen-14B · 未归一化仓库原名 deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
量化Q4_K_M
硬件NVIDIA RTX 3090 · 24G
显存总量
框架llama.cpp b5980
速度与显存
decode tok/s66.3
prefill tok/s2234
TTFT 冷启 ms4280
TTFT 热启 ms
显存峰值 GB11.2
证据与判定
证据级别L0 自报
样本量7
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方Arao 实测
复现链待复现
原始来源
平台Arao 自产
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://araoai.com/demo/rig-run-34内容哈希 a3d89c665805202893b173d0408ec2c11fea4295dd22952ca19235fea3526416快照长度 115 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名055561aadc8de68a701fed6f4155780592b48560972524c6da6f21db4df8d961
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
Qwen3-14BQ4_K_M NVIDIA RTX 3090 · 24Gmlx-lm 0.18.2V2EX最后入库 1 天前n=11 67.7 2291 4280 L0 自报 待复现 稳定
模型与硬件
模型Qwen3-14B仓库原名 Qwen/Qwen3-14B-GGUF
量化Q4_K_M
硬件NVIDIA RTX 3090 · 24G
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s67.7
prefill tok/s2291
TTFT 冷启 ms4280
TTFT 热启 ms
显存峰值 GB11.2
证据与判定
证据级别L0 自报
样本量11
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台V2EX
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.v2ex.com/t/araoai-demo-38内容哈希 1dcaba3287fa3daadc52ea507541cff52b70f77bc7ae57131a46c6fa65373e97快照长度 89 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名95bb7d080802b2738a1683528359f76165bc2c541158d1883a39ebce07096e65
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中
Qwen2.5-7B-Instruct · 未归一化Q4_K_M Arc A770 · 未归一化ExLlamaV2 0.2.5GitHub最后入库 1 天前n=15 87.6 3021 2530 L0 自报 待复现 稳定
模型与硬件
模型Qwen2.5-7B-Instruct · 未归一化仓库原名 Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q4_K_M
硬件Arc A770 · 未归一化
显存总量
框架ExLlamaV2 0.2.5
速度与显存
decode tok/s87.6
prefill tok/s3021
TTFT 冷启 ms2530
TTFT 热启 ms
显存峰值 GB6.4
证据与判定
证据级别L0 自报
样本量15
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台GitHub
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://github.com/araoai-demo/benchmarks/issues/1042内容哈希 548eecb28d83ab636b49cd7a68766126da5168883b695ee6137c51c275d7ea6e快照长度 106 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名175880dc481eb8f0a8ae47b8f9fea2046591cbf98bb52ed4e7f7180751a30907
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: arc_a770;model: Qwen/Qwen2.5-7B-Instruct-GGUF
phi-4 · 未归一化Q4_K_M Apple M3 Max · 128G 统一内存mlx-lm 0.18.2Reddit最后入库 1 天前n=16 28.9 979 4280 L0 自报 待复现 稳定
模型与硬件
模型phi-4 · 未归一化仓库原名 microsoft/phi-4-GGUF
量化Q4_K_M
硬件Apple M3 Max · 128G 统一内存
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s28.9
prefill tok/s979
TTFT 冷启 ms4280
TTFT 热启 ms
显存峰值 GB11.2
证据与判定
证据级别L0 自报
样本量16
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台Reddit
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.reddit.com/r/araoai_demo/comments/demo43_phi-4-gguf/内容哈希 e24ee36646b5052416a04967c0c58ac9848e2bd84b930d27bdc3c1b88339ace6快照长度 96 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名af83e43a101ba7263fc7dd251a6f0c131a923373acc333a1bac2656f72f4fe89
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中model: microsoft/phi-4-GGUF
Mistral-Nemo-Instruct-2407 · 未归一化Q4_K_M RTX 3060 · 未归一化llama.cpp b6120知乎最后入库 1 天前n=4 31.0 1054 3780 L1 已复现 1 次 待判定
模型与硬件
模型Mistral-Nemo-Instruct-2407 · 未归一化仓库原名 mistralai/Mistral-Nemo-Instruct-2407
量化Q4_K_M
硬件RTX 3060 · 未归一化
显存总量
框架llama.cpp b6120
速度与显存
decode tok/s31.0
prefill tok/s1054
TTFT 冷启 ms3780
TTFT 热启 ms
显存峰值 GB9.8
证据与判定
证据级别L1 已复现 1 次
样本量4
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数1
测量方第三方实测
复现链
原始来源
平台知乎
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://zhuanlan.zhihu.com/p/araoai-demo-46内容哈希 8bb209acbe8d57f58bbd1bcdf77be4ef2139e17820d3a4f4fd031aae143f5a3c快照长度 112 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名d4e94c92413c1421af55028bf87bd7dc338d4ad3a8185cb385392f4c17d21d4b
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rtx_3060;model: mistralai/Mistral-Nemo-Instruct-2407
Qwen3-14BQ4_K_M RTX 3060 · 未归一化vLLM 0.6.2Arao 自产最后入库 1 天前n=6 29.8 1040 4280 L0 自报 待复现 待判定
模型与硬件
模型Qwen3-14B仓库原名 Qwen/Qwen3-14B-GGUF
量化Q4_K_M
硬件RTX 3060 · 未归一化
显存总量
框架vLLM 0.6.2
速度与显存
decode tok/s29.8
prefill tok/s1040
TTFT 冷启 ms4280
TTFT 热启 ms
显存峰值 GB11.2
证据与判定
证据级别L0 自报
样本量6
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方Arao 实测
复现链待复现
原始来源
平台Arao 自产
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://araoai.com/demo/rig-run-48内容哈希 b82e4938f343247120c8fc8399ee767253fb07ea00fdf41725b003b1e6731f63快照长度 89 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名f670d6feb01d2e7489c729c33329162cd33f08650806f6a30284856fc2fd171c
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rtx_3060
Qwen3-14BQ4_K_M RX 7900 GRE · 未归一化mlx-lm 0.18.2GitHub最后入库 1 天前n=7 41.7 1410 4280 L0 自报 待复现 待判定
模型与硬件
模型Qwen3-14B仓库原名 Qwen/Qwen3-14B-GGUF
量化Q4_K_M
硬件RX 7900 GRE · 未归一化
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s41.7
prefill tok/s1410
TTFT 冷启 ms4280
TTFT 热启 ms
显存峰值 GB11.2
证据与判定
证据级别L0 自报
样本量7
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台GitHub
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://github.com/araoai-demo/benchmarks/issues/1049内容哈希 1704504f701d191f7d18e823cc906bd1cece4cd8f4b5c6101ce1b305a49bb8d1快照长度 94 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名80684a4188cc8b6cbbbdd266e26ffb1abadd9c4240b0f40bcc3b4a63520d5e2e
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rx_7900_gre
phi-4 · 未归一化Q4_K_M AMD Radeon RX 7900 XTX · 24GExLlamaV2 0.2.5B站最后入库 1 天前n=12 75.1 2590 4280 L0 自报 待复现 稳定
模型与硬件
模型phi-4 · 未归一化仓库原名 microsoft/phi-4-GGUF
量化Q4_K_M
硬件AMD Radeon RX 7900 XTX · 24G
显存总量
框架ExLlamaV2 0.2.5
速度与显存
decode tok/s75.1
prefill tok/s2590
TTFT 冷启 ms4280
TTFT 热启 ms
显存峰值 GB11.2
证据与判定
证据级别L0 自报
样本量12
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台B站
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.bilibili.com/video/araoai-demo-54内容哈希 c082e36c5de970944bfb125e62a1c92de823bcb3491c6c951da88d79beaad7a5快照长度 102 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名e0c6a38ae921e7cc5921bbefbb3dbdd934546dd66e88f235d1d9e08b3f8d84dd
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中model: microsoft/phi-4-GGUF
DeepSeek-R1-Distill-Qwen-14B · 未归一化Q4_K_M RTX 4080 SUPER · 未归一化vLLM 0.6.2知乎最后入库 1 天前n=3 60.8 2127 4280 L0 自报 待复现 待判定
模型与硬件
模型DeepSeek-R1-Distill-Qwen-14B · 未归一化仓库原名 deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
量化Q4_K_M
硬件RTX 4080 SUPER · 未归一化
显存总量
框架vLLM 0.6.2
速度与显存
decode tok/s60.8
prefill tok/s2127
TTFT 冷启 ms4280
TTFT 热启 ms
显存峰值 GB11.2
证据与判定
证据级别L0 自报
样本量3
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台知乎
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://zhuanlan.zhihu.com/p/araoai-demo-60内容哈希 8f720e9c0a200827b6977addf2d108ba57667275ff87b072b4b4d63ccfc8f520快照长度 117 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名4fbe1f3471834ada2ee798fd33a1ee7268ce41da7bd4ca531063baa3959899fd
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rtx_4080_super;model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
Qwen3-32BQ4_K_M M2 Ultra · 未归一化llama.cpp b6120知乎最后入库 1 天前n=10 25.8 878 8780 L0 自报 待复现 稳定
模型与硬件
模型Qwen3-32B仓库原名 Qwen/Qwen3-32B-GGUF
量化Q4_K_M
硬件M2 Ultra · 未归一化
显存总量
框架llama.cpp b6120
速度与显存
decode tok/s25.8
prefill tok/s878
TTFT 冷启 ms8780
TTFT 热启 ms
显存峰值 GB23.5
证据与判定
证据级别L0 自报
样本量10
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台知乎
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://zhuanlan.zhihu.com/p/araoai-demo-67内容哈希 e2d31d52b21f91f7632e7d156ead09986ae90e0f4bfd78c95ccde9d2f2e27aab快照长度 101 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名d1261fd1d256c447488e4bf13b749ea9b518d11df2812594307fc7966eb48c49
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: apple_m2_ultra
导出 CSV JSON 导出当前筛选的全部命中结果(上限 500 条)

按模型看 · 按硬件看

每个取值一页

点一个取值进去,就是它自己的页面:中位吞吐、区间、样本量与证据级别, 以及我们没有收录的组合——缺的那些写清楚是缺,不补数字。下面只列有记录的取值; 没有记录的不在这里,因为我们没有东西可说。

怎么读这张表

  • 证据级别不是我们自己打的标签。它由记录之间的相互验证推导:同一三元组被第三方用不同框架 跑出接近的数字,才升到 L1;跨框架也对得上,才是 L2。Arao 自产的记录即使带签名,在别人复现之前 仍然是 L0。
  • 没有样本量的数字不显示。一行就是一个样本集,四个指标同源;样本量缺失时整行数字渲染 ,因为一个没有 n 的统计值不该被当成结论。
  • 「跑不动」和「没有数据」是两回事。前者是有证据表明显存不够,后者是我们还没收录这个组合 ——把后者读成前者,就是拿机器的沉默冒充人的结论。
  • 导出的上限是服务端强制的。当前视图最多导出 500 行;程序化取全量请走 API
数据 CC BY 4.0 · 可被 AI 引用 复现 ≠ 点赞 来源:GitHub · Reddit · HuggingFace · Arao 自产 方法与边界 投稿指南 API RSS