跑得动araoai.com
投稿
搜什么 常用 M3 Max × Qwen3-32BRX 7900 GRE · 未归一化 × Llama-3.1-8B-Instruct · 未归一化Qwen2.5-7B-Instruct · 未归一化 × mlx-lmQ4_K_M 72 条 Run · 7 个模型 · 10 个硬件型号
全量数据

每一条实测记录,都能追到来源

这是库里的全部实测记录,不是精选。筛选条件写在网址里,所以你复制出去的链接就是你看到的这一屏。 每条记录都标着证据级别:L0 是自报,L1 被第三方复现过,L2 还跨了框架。 想把几个模型或几张卡摆在一张表上比,用横向对比

重置
证据 全部L1 及以上L2 跨框架 入库时间 近 7 天近 30 天全部 命中 12

实测记录

筛选命中 12 条 · 第 1/1 页 · 本页 12 条 · (库中共 72 条)

模型 / 量化 decodetok/s prefilltok/s TTFTms 显存峰值GB 证据 复现链 状态
Llama-3.1-8B-Instruct · 未归一化Q8_0 Apple M3 Max · 128G 统一内存vLLM 0.6.2HuggingFace最后入库 1 天前n=5 32.7 1142 4322 L0 自报 待复现 待判定
模型与硬件
模型Llama-3.1-8B-Instruct · 未归一化仓库原名 meta-llama/Llama-3.1-8B-Instruct
量化Q8_0
硬件Apple M3 Max · 128G 统一内存
显存总量
框架vLLM 0.6.2
速度与显存
decode tok/s32.7
prefill tok/s1142
TTFT 冷启 ms4322
TTFT 热启 ms
显存峰值 GB11.3
证据与判定
证据级别L0 自报
样本量5
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台HuggingFace
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://huggingface.co/araoai-demo/llama-3-1-8b-instruct-bench/discussions/2内容哈希 c895ec078434a9ab4cbd8f8c079edcd2b10a03a66ffb936dd609c23dad404bd5快照长度 111 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名79b2a51fcd3d178d1ee5d2070e329d3c7d87f872c24c0e50788a3e6c9881e436
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中model: meta-llama/Llama-3.1-8B-Instruct
Llama-3.1-8B-Instruct · 未归一化Q5_K_M Arc A770 · 未归一化ExLlamaV2 0.2.5GitHub最后入库 1 天前n=9 65.7 2266 3113 L0 自报 待复现 稳定
模型与硬件
模型Llama-3.1-8B-Instruct · 未归一化仓库原名 meta-llama/Llama-3.1-8B-Instruct
量化Q5_K_M
硬件Arc A770 · 未归一化
显存总量
框架ExLlamaV2 0.2.5
速度与显存
decode tok/s65.7
prefill tok/s2266
TTFT 冷启 ms3113
TTFT 热启 ms
显存峰值 GB8.0
证据与判定
证据级别L0 自报
样本量9
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台GitHub
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://github.com/araoai-demo/benchmarks/issues/1021内容哈希 1970af6d679570eb9901afe507b88f6b4dab6eba83afd33db49a1a91e5512ae0快照长度 109 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名7732c6e850f2fa3f3db30de489e29c4a013dbc3de868e64e688cecbafcca74a0
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: arc_a770;model: meta-llama/Llama-3.1-8B-Instruct
Llama-3.1-8B-Instruct · 未归一化AWQ 4-bit Arc A770 · 未归一化llama.cpp b5980V2EX最后入库 1 天前n=12 74.1 2495 2655 L0 自报 待复现 稳定
模型与硬件
模型Llama-3.1-8B-Instruct · 未归一化仓库原名 meta-llama/Llama-3.1-8B-Instruct
量化AWQ 4-bit
硬件Arc A770 · 未归一化
显存总量
框架llama.cpp b5980
速度与显存
decode tok/s74.1
prefill tok/s2495
TTFT 冷启 ms2655
TTFT 热启 ms
显存峰值 GB6.7
证据与判定
证据级别L0 自报
样本量12
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台V2EX
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.v2ex.com/t/araoai-demo-24内容哈希 79c63dbc693571940e2a6f469668e2da557a650ed03d987118e64b55b403bc80快照长度 109 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名909d093eff268698fcfbc9cf8f6d91b27ecc0a03159c515453cba78fc54ab36f
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: arc_a770;model: meta-llama/Llama-3.1-8B-Instruct
Llama-3.1-8B-Instruct · 未归一化Q4_K_M RX 7800 XT · 未归一化ExLlamaV2 0.2.5GitHub最后入库 1 天前n=16 85.4 2946 2780 L2 跨框架已验证 稳定
模型与硬件
模型Llama-3.1-8B-Instruct · 未归一化仓库原名 meta-llama/Llama-3.1-8B-Instruct
量化Q4_K_M
硬件RX 7800 XT · 未归一化
显存总量
框架ExLlamaV2 0.2.5
速度与显存
decode tok/s85.4
prefill tok/s2946
TTFT 冷启 ms2780
TTFT 热启 ms
显存峰值 GB7.1
证据与判定
证据级别L2 跨框架已验证
样本量16
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数3
测量方第三方实测
复现链
原始来源
平台GitHub
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://github.com/araoai-demo/benchmarks/issues/1028内容哈希 ce3579e8e42587b887786363f1b07926648b89353d02c090da467ef3557b06ef快照长度 111 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名32c2b8d6e58ee592f9fb76b6d56125d538379db9f604ff3a5ef29246b6358685
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rx_7800_xt;model: meta-llama/Llama-3.1-8B-Instruct
Llama-3.1-8B-Instruct · 未归一化Q4_K_M RX 7800 XT · 未归一化mlx-lm 0.18.2Reddit最后入库 1 天前n=17 79.0 2673 2780 L2 跨框架已验证 稳定
模型与硬件
模型Llama-3.1-8B-Instruct · 未归一化仓库原名 meta-llama/Llama-3.1-8B-Instruct
量化Q4_K_M
硬件RX 7800 XT · 未归一化
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s79.0
prefill tok/s2673
TTFT 冷启 ms2780
TTFT 热启 ms
显存峰值 GB7.1
证据与判定
证据级别L2 跨框架已验证
样本量17
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数2
测量方第三方实测
复现链
原始来源
平台Reddit
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.reddit.com/r/araoai_demo/comments/demo2900_llama-3-1-8b-instruct/内容哈希 32f1e4081cdfcabc83fae48962d208dd5436c5e75996ef6b866e10020c31219c快照长度 106 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名af6222c6ef6ddc4dc3f66135f6f8efc0e0ff11c5236bc7f7604757e0521217a4
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rx_7800_xt;model: meta-llama/Llama-3.1-8B-Instruct
Llama-3.1-8B-Instruct · 未归一化Q6_K RX 7900 GRE · 未归一化vLLM 0.6.2V2EX最后入库 1 天前n=4 60.6 2119 3530 L0 自报 待复现 待判定
模型与硬件
模型Llama-3.1-8B-Instruct · 未归一化仓库原名 meta-llama/Llama-3.1-8B-Instruct
量化Q6_K
硬件RX 7900 GRE · 未归一化
显存总量
框架vLLM 0.6.2
速度与显存
decode tok/s60.6
prefill tok/s2119
TTFT 冷启 ms3530
TTFT 热启 ms
显存峰值 GB9.1
证据与判定
证据级别L0 自报
样本量4
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台V2EX
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.v2ex.com/t/araoai-demo-31内容哈希 0801fec71022a8416d6443e20b83f5d03295d70aabaceddd4241e0007b7ac338快照长度 103 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名ea632779cd9218a8203633d3d1e3edd4fb5c5ca0d37ea3f273f72fc6263f4379
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rx_7900_gre;model: meta-llama/Llama-3.1-8B-Instruct;quant: Q6_K
Llama-3.1-8B-Instruct · 未归一化Q5_K_M NVIDIA RTX 3090 · 24GExLlamaV2 0.2.5B站最后入库 1 天前n=13 109.8 3788 3113 L0 自报 待复现 稳定
模型与硬件
模型Llama-3.1-8B-Instruct · 未归一化仓库原名 meta-llama/Llama-3.1-8B-Instruct
量化Q5_K_M
硬件NVIDIA RTX 3090 · 24G
显存总量
框架ExLlamaV2 0.2.5
速度与显存
decode tok/s109.8
prefill tok/s3788
TTFT 冷启 ms3113
TTFT 热启 ms
显存峰值 GB8.0
证据与判定
证据级别L0 自报
样本量13
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台B站
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.bilibili.com/video/araoai-demo-40内容哈希 d187fb33af1928418561cf2dec25abedfe43d7758bb2f8ec95a6f327ca5457b6快照长度 112 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名604b10f5abd75c057c6de75b7ae33cf05c3281806e523d5607df0e3c42ce118a
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中model: meta-llama/Llama-3.1-8B-Instruct
Llama-3.1-8B-Instruct · 未归一化AWQ 4-bit RX 7900 GRE · 未归一化mlx-lm 0.18.2V2EX最后入库 1 天前n=17 77.8 2632 2655 L0 自报 待复现 稳定
模型与硬件
模型Llama-3.1-8B-Instruct · 未归一化仓库原名 meta-llama/Llama-3.1-8B-Instruct
量化AWQ 4-bit
硬件RX 7900 GRE · 未归一化
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s77.8
prefill tok/s2632
TTFT 冷启 ms2655
TTFT 热启 ms
显存峰值 GB6.7
证据与判定
证据级别L0 自报
样本量17
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台V2EX
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.v2ex.com/t/araoai-demo-59内容哈希 4d0bd5dd22b4397ecae0529099cfca76f83a50f10a2caf499d102fe190c25c96快照长度 107 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名0ede28561ef9b98d9cb71c80976b501af4502929ec04ef7022574d02b8b54806
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rx_7900_gre;model: meta-llama/Llama-3.1-8B-Instruct
Llama-3.1-8B-Instruct · 未归一化AWQ 4-bit RTX 4080 SUPER · 未归一化vLLM 0.6.2B站最后入库 1 天前n=4 113.6 3971 2655 L0 自报 待复现 待判定
模型与硬件
模型Llama-3.1-8B-Instruct · 未归一化仓库原名 meta-llama/Llama-3.1-8B-Instruct
量化AWQ 4-bit
硬件RTX 4080 SUPER · 未归一化
显存总量
框架vLLM 0.6.2
速度与显存
decode tok/s113.6
prefill tok/s3971
TTFT 冷启 ms2655
TTFT 热启 ms
显存峰值 GB6.7
证据与判定
证据级别L0 自报
样本量4
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台B站
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.bilibili.com/video/araoai-demo-61内容哈希 3bc90c7926e7769fde8c72d1946442d6318d8eb0c00758b6be4ce89a4ca5fcca快照长度 115 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名cb7364809d2bbd9dd935c55c9a61bd0912a340536bc83dab3d4ed2a4839a65d1
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rtx_4080_super;model: meta-llama/Llama-3.1-8B-Instruct
Llama-3.1-8B-Instruct · 未归一化Q5_K_M Apple M3 Max · 128G 统一内存mlx-lm 0.18.2GitHub最后入库 1 天前n=6 43.4 1469 3113 L0 自报 待复现 待判定
模型与硬件
模型Llama-3.1-8B-Instruct · 未归一化仓库原名 meta-llama/Llama-3.1-8B-Instruct
量化Q5_K_M
硬件Apple M3 Max · 128G 统一内存
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s43.4
prefill tok/s1469
TTFT 冷启 ms3113
TTFT 热启 ms
显存峰值 GB8.0
证据与判定
证据级别L0 自报
样本量6
状态待判定

「待判定」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台GitHub
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://github.com/araoai-demo/benchmarks/issues/1063内容哈希 bf039634e13290b6341afb90614b71b4b4f60ac13bf0d2428f7550629bd4ffb0快照长度 108 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名800faa438d922a5721abf378fc29b69f3e94fbabd96cfdf1e05a7e5d81a428a4
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中model: meta-llama/Llama-3.1-8B-Instruct
Llama-3.1-8B-Instruct · 未归一化Q8_0 RX 7900 GRE · 未归一化mlx-lm 0.18.2V2EX最后入库 1 天前n=9 41.2 1393 4322 L0 自报 待复现 稳定
模型与硬件
模型Llama-3.1-8B-Instruct · 未归一化仓库原名 meta-llama/Llama-3.1-8B-Instruct
量化Q8_0
硬件RX 7900 GRE · 未归一化
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s41.2
prefill tok/s1393
TTFT 冷启 ms4322
TTFT 热启 ms
显存峰值 GB11.3
证据与判定
证据级别L0 自报
样本量9
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台V2EX
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.v2ex.com/t/araoai-demo-66内容哈希 eb04af7fe0acbc6eb8ff9ffac17aaae4cd7037175e3a8e702ffff6312e96568e快照长度 103 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名6e4687630cb407a876b228d240fa8ddac39926667975d0c5bedc26b3e93eb864
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rx_7900_gre;model: meta-llama/Llama-3.1-8B-Instruct
Llama-3.1-8B-Instruct · 未归一化Q8_0 RX 7800 XT · 未归一化mlx-lm 0.18.2Reddit最后入库 1 天前n=14 44.6 1509 4322 L0 自报 待复现 稳定
模型与硬件
模型Llama-3.1-8B-Instruct · 未归一化仓库原名 meta-llama/Llama-3.1-8B-Instruct
量化Q8_0
硬件RX 7800 XT · 未归一化
显存总量
框架mlx-lm 0.18.2
速度与显存
decode tok/s44.6
prefill tok/s1509
TTFT 冷启 ms4322
TTFT 热启 ms
显存峰值 GB11.3
证据与判定
证据级别L0 自报
样本量14
状态稳定

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

要和另一条记录直接比较,这几项得一样:模型 · 量化 · 框架(含版本) · 上下文长度 · 硬件 · batch · 并发数。少一项就只能当数量级参考——差额可能来自那一项,而不是你想比的东西。

完整配置 · 来源 · 复现链 16 项
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
投机解码
并发数
上下文扩展
复现与测量
复现次数0
测量方第三方实测
复现链待复现
原始来源
平台Reddit
抓取时间1 天前
原文快照我们存下的原文副本(本站不转载正文) · 抓取于 1 天前 · 来源 https://www.reddit.com/r/araoai_demo/comments/demo71_llama-3-1-8b-instruct/内容哈希 80d6e9a8fb3ff139a4fb4c1c367718c361f591d56338b7301e5181cbfc7c10dc快照长度 104 字符(按码点计)

我们存下了抓取那一刻的原文副本与内容哈希,但不转载原文:本站只取事实(数字),不取表达。来源被删除或改版之后,我们可以拿哈希说明「当时读到的就是这段文本」,但不能说明它现在还在。

相关断言

目前没有断言引用这条记录

高级元数据 5 项
配置指纹
配置签名d471fe9e895661b4516ca811ce25207650498d8de2d7ceb58bc59fd16ef1460e
实验指标
KLD
MTP 接受率
整机功耗 W
归一化
归一化未命中hardware: rx_7800_xt;model: meta-llama/Llama-3.1-8B-Instruct
导出 CSV JSON 导出当前筛选的全部命中结果(上限 500 条)

按模型看 · 按硬件看

每个取值一页

点一个取值进去,就是它自己的页面:中位吞吐、区间、样本量与证据级别, 以及我们没有收录的组合——缺的那些写清楚是缺,不补数字。下面只列有记录的取值; 没有记录的不在这里,因为我们没有东西可说。

怎么读这张表

  • 证据级别不是我们自己打的标签。它由记录之间的相互验证推导:同一三元组被第三方用不同框架 跑出接近的数字,才升到 L1;跨框架也对得上,才是 L2。Arao 自产的记录即使带签名,在别人复现之前 仍然是 L0。
  • 没有样本量的数字不显示。一行就是一个样本集,四个指标同源;样本量缺失时整行数字渲染 ,因为一个没有 n 的统计值不该被当成结论。
  • 「跑不动」和「没有数据」是两回事。前者是有证据表明显存不够,后者是我们还没收录这个组合 ——把后者读成前者,就是拿机器的沉默冒充人的结论。
  • 导出的上限是服务端强制的。当前视图最多导出 500 行;程序化取全量请走 API
数据 CC BY 4.0 · 可被 AI 引用 复现 ≠ 点赞 来源:GitHub · Reddit · HuggingFace · Arao 自产 方法与边界 投稿指南 API RSS