跑得动araoai.com
投稿
搜什么 常用 72 条 Run · 7 个模型 · 10 个硬件型号
全量数据

每一条实测记录,都能追到来源

这是库里的全部实测记录,不是精选。筛选条件写在网址里,所以你复制出去的链接就是你看到的这一屏。 每条记录都标着证据级别:L0 是自报,L1 被第三方复现过,L2 还跨了框架。

重置
证据 全部L1 及以上L2 跨框架 入库时间 近 7 天近 30 天全部 命中 21

实测记录

筛选命中 21 条 · 第 1/1 页 · 本页 21 条 · (库中共 72 条)

模型 / 量化 decodetok/s prefilltok/s TTFTms 显存峰值GB 证据 复现链 状态
meta-llama/Llama-3.1-8B-InstructQ8_0 Apple M3 Max · 128G 统一内存vLLM 0.6.2HuggingFace最后入库 19 小时前n=5 32.7 1142 4322 L1 已复现 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB11.3
显存总量
样本量5
复现次数0
硬件Apple M3 Max · 128G 统一内存
模型meta-llama/Llama-3.1-8B-Instruct
量化Q8_0
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名79b2a51fcd3d178d1ee5d2070e329d3c7d87f872c24c0e50788a3e6c9881e436
复现链
窄屏隐藏的列
框架vLLM 0.6.2
prefill tok/s1142
TTFT 冷启 ms4322
decode tok/s32.7
归一化未命中model: meta-llama/Llama-3.1-8B-Instruct
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台HuggingFace
抓取时间19 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen/Qwen2.5-7B-Instruct-GGUFAWQ 4-bit Apple M3 Max · 128G 统一内存vLLM 0.6.2知乎最后入库 19 小时前n=7 70.5 2466 2421 L2 跨框架已验证 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB6.1
显存总量
样本量7
复现次数0
硬件Apple M3 Max · 128G 统一内存
模型Qwen/Qwen2.5-7B-Instruct-GGUF
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L2 跨框架已验证
测量方站方自产
配置签名1a7de696fb9be50cf2e6941e9361aaf080c9732e74b19a0278b6153b0e7e76e2
复现链
窄屏隐藏的列
框架vLLM 0.6.2
prefill tok/s2466
TTFT 冷启 ms2421
decode tok/s70.5
归一化未命中model: Qwen/Qwen2.5-7B-Instruct-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台知乎
抓取时间19 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

microsoft/phi-4-GGUFQ6_K NVIDIA RTX 3090 · 24Gllama.cpp b5980GitHub最后入库 19 小时前n=10 48.2 1625 5592 L1 已复现 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB14.8
显存总量
样本量10
复现次数0
硬件NVIDIA RTX 3090 · 24G
模型microsoft/phi-4-GGUF
量化Q6_K
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名0d37268c8af4fb95412ad26534751d6624580de7b999fedf27df41f2077eb8d0
复现链
窄屏隐藏的列
框架llama.cpp b5980
prefill tok/s1625
TTFT 冷启 ms5592
decode tok/s48.2
归一化未命中model: microsoft/phi-4-GGUF;quant: Q6_K
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台GitHub
抓取时间19 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen3-32BQ4_K_M Apple M3 Max · 128G 统一内存llama.cpp b6120B站最后入库 19 小时前n=15 12.9 439 8780 L1 已复现 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB23.5
显存总量
样本量15
复现次数0
硬件Apple M3 Max · 128G 统一内存
模型Qwen3-32B
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名a648db8efc305f6c447e86acdd56df39f2ec03c7d15fd2fa39a4c5abbe64c14a
复现链
窄屏隐藏的列
框架llama.cpp b6120
prefill tok/s439
TTFT 冷启 ms8780
decode tok/s12.9
归一化未命中
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台B站
抓取时间19 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen/Qwen2.5-7B-Instruct-GGUFAWQ 4-bit AMD Radeon RX 7900 XTX · 24GvLLM 0.6.2Reddit最后入库 19 小时前n=3 169.3 5919 2421 L2 跨框架已验证 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB6.1
显存总量
样本量3
复现次数0
硬件AMD Radeon RX 7900 XTX · 24G
模型Qwen/Qwen2.5-7B-Instruct-GGUF
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L2 跨框架已验证
测量方站方自产
配置签名e41d5dd004847cf6ef7666b0d0857270dbed7957056a850b86fca5537a6a75b0
复现链
窄屏隐藏的列
框架vLLM 0.6.2
prefill tok/s5919
TTFT 冷启 ms2421
decode tok/s169.3
归一化未命中model: Qwen/Qwen2.5-7B-Instruct-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台Reddit
抓取时间19 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen/Qwen2.5-7B-Instruct-GGUFQ4_K_M apple_m2_ultraollama 0.5.1V2EX最后入库 19 小时前n=5 109.8 3673 2530 L1 已复现 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB6.4
显存总量
样本量5
复现次数0
硬件apple_m2_ultra
模型Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名c1d6865a182b23e79a00778e5549b57f89580f646eb7ce4523d67b907527de20
复现链
窄屏隐藏的列
框架ollama 0.5.1
prefill tok/s3673
TTFT 冷启 ms2530
decode tok/s109.8
归一化未命中hardware: apple_m2_ultra;model: Qwen/Qwen2.5-7B-Instruct-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台V2EX
抓取时间19 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen/Qwen2.5-7B-Instruct-GGUFFP16 apple_m2_ultramlx-lm 0.18.2Reddit最后入库 19 小时前n=10 34.7 1175 6613 L1 已复现 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB17.6
显存总量
样本量10
复现次数0
硬件apple_m2_ultra
模型Qwen/Qwen2.5-7B-Instruct-GGUF
量化FP16
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名863a8d833495a4be2a524f568758c0784faee6af1f5bcf6f87aa8adbf4131372
复现链
窄屏隐藏的列
框架mlx-lm 0.18.2
prefill tok/s1175
TTFT 冷启 ms6613
decode tok/s34.7
归一化未命中hardware: apple_m2_ultra;model: Qwen/Qwen2.5-7B-Instruct-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台Reddit
抓取时间19 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen/Qwen2.5-7B-Instruct-GGUFQ6_K apple_m2_ultraExLlamaV2 0.2.5B站最后入库 19 小时前n=14 91.0 3139 3186 L2 跨框架已验证 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB8.2
显存总量
样本量14
复现次数0
硬件apple_m2_ultra
模型Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q6_K
投机解码
并发数
上下文扩展
证据级别L2 跨框架已验证
测量方站方自产
配置签名3a70dab39c6caeb6a1382ed620aef5bce10a646a6254f82c045e2df9e869fa13
复现链
窄屏隐藏的列
框架ExLlamaV2 0.2.5
prefill tok/s3139
TTFT 冷启 ms3186
decode tok/s91.0
归一化未命中hardware: apple_m2_ultra;model: Qwen/Qwen2.5-7B-Instruct-GGUF;quant: Q6_K
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台B站
抓取时间19 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

meta-llama/Llama-3.1-8B-InstructQ4_K_M rx_7800_xtExLlamaV2 0.2.5站方自产最后入库 19 小时前n=15 85.4 2946 2780 L1 已复现 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB7.1
显存总量
样本量15
复现次数0
硬件rx_7800_xt
模型meta-llama/Llama-3.1-8B-Instruct
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名96c0a37d078bfd35ff8a62d16541325fc9dfd3a0f0cf26d24e4cb0ae5e8f2245
复现链
窄屏隐藏的列
框架ExLlamaV2 0.2.5
prefill tok/s2946
TTFT 冷启 ms2780
decode tok/s85.4
归一化未命中hardware: rx_7800_xt;model: meta-llama/Llama-3.1-8B-Instruct
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台站方自产
抓取时间19 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

deepseek-ai/DeepSeek-R1-Distill-Qwen-14BQ4_K_M NVIDIA RTX 3090 · 24Gllama.cpp b5980知乎最后入库 19 小时前n=5 66.3 2234 4280 L1 已复现 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB11.2
显存总量
样本量5
复现次数0
硬件NVIDIA RTX 3090 · 24G
模型deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名5b731bde756c87f7f6c0332d756a28d45f3c34fca39ac0632fea934fc2242ae2
复现链
窄屏隐藏的列
框架llama.cpp b5980
prefill tok/s2234
TTFT 冷启 ms4280
decode tok/s66.3
归一化未命中model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台知乎
抓取时间19 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

deepseek-ai/DeepSeek-R1-Distill-Qwen-14BFP16 Apple M3 Max · 128G 统一内存mlx-lm 0.18.2HuggingFace最后入库 19 小时前n=10 8.7 294 12447 L1 已复现 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB33.5
显存总量
样本量10
复现次数0
硬件Apple M3 Max · 128G 统一内存
模型deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
量化FP16
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名89de7107f9cc4bb67c7fbf5fa95b917e19fc07e78f4b6b1949c54e3d26053de9
复现链
窄屏隐藏的列
框架mlx-lm 0.18.2
prefill tok/s294
TTFT 冷启 ms12447
decode tok/s8.7
归一化未命中model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台HuggingFace
抓取时间19 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen3-14BQ6_K rtx_4080_superollama 0.5.1GitHub最后入库 19 小时前n=15 36.7 1229 5592 L1 已复现 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB14.8
显存总量
样本量15
复现次数0
硬件rtx_4080_super
模型Qwen3-14B
量化Q6_K
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名effd3db70d7240f2e0e8ccc42655b784c09d028026dc2c077013f5fdee37dedb
复现链
窄屏隐藏的列
框架ollama 0.5.1
prefill tok/s1229
TTFT 冷启 ms5592
decode tok/s36.7
归一化未命中hardware: rtx_4080_super;quant: Q6_K
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台GitHub
抓取时间19 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

deepseek-ai/DeepSeek-R1-Distill-Qwen-14BAWQ 4-bit rx_7900_greollama 0.5.1B站最后入库 19 小时前n=5 42.2 1410 4061 L1 已复现 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB10.6
显存总量
样本量5
复现次数0
硬件rx_7900_gre
模型deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名90f5ca07fef974cba06a44a8aafb08762cd01056de1dbd4d0683c35e074b412e
复现链
窄屏隐藏的列
框架ollama 0.5.1
prefill tok/s1410
TTFT 冷启 ms4061
decode tok/s42.2
归一化未命中hardware: rx_7900_gre;model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台B站
抓取时间19 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen3-14BQ4_K_M rtx_3060vLLM 0.6.2站方自产最后入库 19 小时前n=6 29.8 1040 4280 L2 跨框架已验证 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB11.2
显存总量
样本量6
复现次数0
硬件rtx_3060
模型Qwen3-14B
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L2 跨框架已验证
测量方站方自产
配置签名f670d6feb01d2e7489c729c33329162cd33f08650806f6a30284856fc2fd171c
复现链
窄屏隐藏的列
框架vLLM 0.6.2
prefill tok/s1040
TTFT 冷启 ms4280
decode tok/s29.8
归一化未命中hardware: rtx_3060
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台站方自产
抓取时间19 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

mistralai/Mistral-Nemo-Instruct-2407Q5_K_M rtx_3060ExLlamaV2 0.2.5V2EX最后入库 19 小时前n=10 28.2 971 4280 L1 已复现 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB11.2
显存总量
样本量10
复现次数0
硬件rtx_3060
模型mistralai/Mistral-Nemo-Instruct-2407
量化Q5_K_M
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名c2b82c0ea9c9131935d5be9a4b14b196be234a75c267ec78de7cfe3821bf2a22
复现链
窄屏隐藏的列
框架ExLlamaV2 0.2.5
prefill tok/s971
TTFT 冷启 ms4280
decode tok/s28.2
归一化未命中hardware: rtx_3060;model: mistralai/Mistral-Nemo-Instruct-2407
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台V2EX
抓取时间19 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

deepseek-ai/DeepSeek-R1-Distill-Qwen-14BAWQ 4-bit rx_7800_xtExLlamaV2 0.2.5Reddit最后入库 19 小时前n=15 52.1 1796 4061 L1 已复现 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB10.6
显存总量
样本量15
复现次数0
硬件rx_7800_xt
模型deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名6dccec6bdc53ac83eb70c9291e713ff8ab504cff048ac4964dd6ef4bdac22dc7
复现链
窄屏隐藏的列
框架ExLlamaV2 0.2.5
prefill tok/s1796
TTFT 冷启 ms4061
decode tok/s52.1
归一化未命中hardware: rx_7800_xt;model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台Reddit
抓取时间19 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

meta-llama/Llama-3.1-8B-InstructQ6_K rx_7900_grellama.cpp b5980V2EX最后入库 19 小时前n=17 51.9 1750 3530 L2 跨框架已验证 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB9.1
显存总量
样本量17
复现次数0
硬件rx_7900_gre
模型meta-llama/Llama-3.1-8B-Instruct
量化Q6_K
投机解码
并发数
上下文扩展
证据级别L2 跨框架已验证
测量方站方自产
配置签名a733e90863e38211d60780c8d1343bc785affa038a2eb5c3a76c7174462a70de
复现链
窄屏隐藏的列
框架llama.cpp b5980
prefill tok/s1750
TTFT 冷启 ms3530
decode tok/s51.9
归一化未命中hardware: rx_7900_gre;model: meta-llama/Llama-3.1-8B-Instruct;quant: Q6_K
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台V2EX
抓取时间19 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

meta-llama/Llama-3.1-8B-InstructAWQ 4-bit rx_7900_gremlx-lm 0.18.2站方自产最后入库 19 小时前n=5 77.8 2632 2655 L1 已复现 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB6.7
显存总量
样本量5
复现次数0
硬件rx_7900_gre
模型meta-llama/Llama-3.1-8B-Instruct
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名24344e7350328db45c7bd1d0d240791e5ccaf2b20e886ce462308ed9454f7983
复现链
窄屏隐藏的列
框架mlx-lm 0.18.2
prefill tok/s2632
TTFT 冷启 ms2655
decode tok/s77.8
归一化未命中hardware: rx_7900_gre;model: meta-llama/Llama-3.1-8B-Instruct
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台站方自产
抓取时间19 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen3-14BQ5_K_M apple_m2_ultraollama 0.5.1知乎最后入库 19 小时前n=10 47.1 1574 4863 L1 已复现 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB12.8
显存总量
样本量10
复现次数0
硬件apple_m2_ultra
模型Qwen3-14B
量化Q5_K_M
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名1d40cdefe27a7a47367d6d052d99e4c4def3e5c26205dda91dacce063e3757e7
复现链
窄屏隐藏的列
框架ollama 0.5.1
prefill tok/s1574
TTFT 冷启 ms4863
decode tok/s47.1
归一化未命中hardware: apple_m2_ultra
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台知乎
抓取时间19 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen3-32BQ4_K_M apple_m2_ultrallama.cpp b6120GitHub最后入库 19 小时前n=13 25.8 878 8780 L2 跨框架已验证 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB23.5
显存总量
样本量13
复现次数0
硬件apple_m2_ultra
模型Qwen3-32B
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L2 跨框架已验证
测量方站方自产
配置签名3d9db31a35b19986dcf76e852bd804a0ca85848ce0cf5e2f982514f23bb072fb
复现链
窄屏隐藏的列
框架llama.cpp b6120
prefill tok/s878
TTFT 冷启 ms8780
decode tok/s25.8
归一化未命中hardware: apple_m2_ultra
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台GitHub
抓取时间19 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen3-32BQ5_K_M Apple M3 Max · 128G 统一内存llama.cpp b5980HuggingFace最后入库 19 小时前n=15 10.6 358 10113 L1 已复现 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB27.1
显存总量
样本量15
复现次数0
硬件Apple M3 Max · 128G 统一内存
模型Qwen3-32B
量化Q5_K_M
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名145c3e1ae16df854078eeeb1eef9b690eb3299095866fc0d69c4cd33a5951f90
复现链
窄屏隐藏的列
框架llama.cpp b5980
prefill tok/s358
TTFT 冷启 ms10113
decode tok/s10.6
归一化未命中
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台HuggingFace
抓取时间19 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

导出 CSV JSON 导出当前筛选的全部命中结果(上限 500 条)

怎么读这张表

  • 证据级别不是我们自己打的标签。它由记录之间的相互验证推导:同一三元组被第三方用不同框架 跑出接近的数字,才升到 L1;跨框架也对得上,才是 L2。站方自产的记录即使带签名,在别人复现之前 仍然是 L0。
  • 没有样本量的数字不显示。一行就是一个样本集,四个指标同源;样本量缺失时整行数字渲染 ,因为一个没有 n 的统计值不该被当成结论。
  • 「跑不动」和「没有数据」是两回事。前者是有证据表明显存不够,后者是我们还没收录这个组合 ——把后者读成前者,就是拿机器的沉默冒充人的结论。
  • 导出的上限是服务端强制的。当前视图最多导出 500 行;程序化取全量请走 API
数据 CC BY 4.0 · 可被 AI 引用 复现 ≠ 点赞 来源:GitHub · Reddit · HuggingFace · 站方自产 方法与边界 投稿指南 API RSS