跑得动araoai.com
投稿
搜什么 常用 72 条 Run · 7 个模型 · 10 个硬件型号
全量数据

每一条实测记录,都能追到来源

这是库里的全部实测记录,不是精选。筛选条件写在网址里,所以你复制出去的链接就是你看到的这一屏。 每条记录都标着证据级别:L0 是自报,L1 被第三方复现过,L2 还跨了框架。

重置
证据 全部L1 及以上L2 跨框架 入库时间 近 7 天近 30 天全部 命中 72

实测记录

筛选命中 72 条 · 第 2/2 页 · 本页 22 条

模型 / 量化 decodetok/s prefilltok/s TTFTms 显存峰值GB 证据 复现链 状态
microsoft/phi-4-GGUFAWQ 4-bit Apple M3 Max · 128G 统一内存ollama 0.5.1HuggingFace最后入库 20 小时前n=9 29.3 979 4061 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB10.6
显存总量
样本量9
复现次数0
硬件Apple M3 Max · 128G 统一内存
模型microsoft/phi-4-GGUF
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名0433b15e9e706cdc286ccf75de47656c8dad78e85ef942824c51eec016be5d7e
复现链
窄屏隐藏的列
框架ollama 0.5.1
prefill tok/s979
TTFT 冷启 ms4061
decode tok/s29.3
归一化未命中model: microsoft/phi-4-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台HuggingFace
抓取时间20 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

mistralai/Mistral-Nemo-Instruct-2407Q5_K_M rtx_3060ExLlamaV2 0.2.5V2EX最后入库 20 小时前n=10 28.2 971 4280 L1 已复现 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB11.2
显存总量
样本量10
复现次数0
硬件rtx_3060
模型mistralai/Mistral-Nemo-Instruct-2407
量化Q5_K_M
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名c2b82c0ea9c9131935d5be9a4b14b196be234a75c267ec78de7cfe3821bf2a22
复现链
窄屏隐藏的列
框架ExLlamaV2 0.2.5
prefill tok/s971
TTFT 冷启 ms4280
decode tok/s28.2
归一化未命中hardware: rtx_3060;model: mistralai/Mistral-Nemo-Instruct-2407
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台V2EX
抓取时间20 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen/Qwen2.5-7B-Instruct-GGUFAWQ 4-bit rtx_3060mlx-lm 0.18.2知乎最后入库 20 小时前n=11 55.6 1880 2421 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB6.1
显存总量
样本量11
复现次数0
硬件rtx_3060
模型Qwen/Qwen2.5-7B-Instruct-GGUF
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名287684476b2eb094864024dd20ca52807ac2f3d1bb4a407ea725e6928a20b3db
复现链
窄屏隐藏的列
框架mlx-lm 0.18.2
prefill tok/s1880
TTFT 冷启 ms2421
decode tok/s55.6
归一化未命中hardware: rtx_3060;model: Qwen/Qwen2.5-7B-Instruct-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台知乎
抓取时间20 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

microsoft/phi-4-GGUFQ4_K_M AMD Radeon RX 7900 XTX · 24GExLlamaV2 0.2.5B站最后入库 20 小时前n=12 75.1 2590 4280 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB11.2
显存总量
样本量12
复现次数0
硬件AMD Radeon RX 7900 XTX · 24G
模型microsoft/phi-4-GGUF
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名e0c6a38ae921e7cc5921bbefbb3dbdd934546dd66e88f235d1d9e08b3f8d84dd
复现链
窄屏隐藏的列
框架ExLlamaV2 0.2.5
prefill tok/s2590
TTFT 冷启 ms4280
decode tok/s75.1
归一化未命中model: microsoft/phi-4-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台B站
抓取时间20 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

deepseek-ai/DeepSeek-R1-Distill-Qwen-14BQ6_K arc_a770vLLM 0.6.2站方自产最后入库 20 小时前n=13 33.7 1177 5592 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB14.8
显存总量
样本量13
复现次数0
硬件arc_a770
模型deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
量化Q6_K
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名91ec73d1652cd69df76b3a9b0dff064187616da2ca562d88015dab41fd16e066
复现链
窄屏隐藏的列
框架vLLM 0.6.2
prefill tok/s1177
TTFT 冷启 ms5592
decode tok/s33.7
归一化未命中hardware: arc_a770;model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B;quant: Q6_K
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台站方自产
抓取时间20 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

microsoft/phi-4-GGUFAWQ 4-bit Apple M3 Max · 128G 统一内存ExLlamaV2 0.2.5GitHub最后入库 20 小时前n=14 33.4 1151 4061 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB10.6
显存总量
样本量14
复现次数0
硬件Apple M3 Max · 128G 统一内存
模型microsoft/phi-4-GGUF
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名bfc19833c92fb5f243a4298abc955e937795d8619e8e122fc53f63cbb8f4c30e
复现链
窄屏隐藏的列
框架ExLlamaV2 0.2.5
prefill tok/s1151
TTFT 冷启 ms4061
decode tok/s33.4
归一化未命中model: microsoft/phi-4-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台GitHub
抓取时间20 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

deepseek-ai/DeepSeek-R1-Distill-Qwen-14BAWQ 4-bit rx_7800_xtExLlamaV2 0.2.5Reddit最后入库 20 小时前n=15 52.1 1796 4061 L1 已复现 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB10.6
显存总量
样本量15
复现次数0
硬件rx_7800_xt
模型deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名6dccec6bdc53ac83eb70c9291e713ff8ab504cff048ac4964dd6ef4bdac22dc7
复现链
窄屏隐藏的列
框架ExLlamaV2 0.2.5
prefill tok/s1796
TTFT 冷启 ms4061
decode tok/s52.1
归一化未命中hardware: rx_7800_xt;model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台Reddit
抓取时间20 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

microsoft/phi-4-GGUFAWQ 4-bit rtx_4080_superllama.cpp b6120HuggingFace最后入库 20 小时前n=16 57.9 1970 4061 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB10.6
显存总量
样本量16
复现次数0
硬件rtx_4080_super
模型microsoft/phi-4-GGUF
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名ac3633d92415069249c8a5dfb5e4f341021d4d8b0d54aa9041f40463cf52b18d
复现链
窄屏隐藏的列
框架llama.cpp b6120
prefill tok/s1970
TTFT 冷启 ms4061
decode tok/s57.9
归一化未命中hardware: rtx_4080_super;model: microsoft/phi-4-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台HuggingFace
抓取时间20 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

meta-llama/Llama-3.1-8B-InstructQ6_K rx_7900_grellama.cpp b5980V2EX最后入库 20 小时前n=17 51.9 1750 3530 L2 跨框架已验证 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB9.1
显存总量
样本量17
复现次数0
硬件rx_7900_gre
模型meta-llama/Llama-3.1-8B-Instruct
量化Q6_K
投机解码
并发数
上下文扩展
证据级别L2 跨框架已验证
测量方站方自产
配置签名a733e90863e38211d60780c8d1343bc785affa038a2eb5c3a76c7174462a70de
复现链
窄屏隐藏的列
框架llama.cpp b5980
prefill tok/s1750
TTFT 冷启 ms3530
decode tok/s51.9
归一化未命中hardware: rx_7900_gre;model: meta-llama/Llama-3.1-8B-Instruct;quant: Q6_K
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台V2EX
抓取时间20 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

deepseek-ai/DeepSeek-R1-Distill-Qwen-14BQ8_0 Apple M3 Max · 128G 统一内存llama.cpp b5980知乎最后入库 20 小时前n=3 16.0 539 6978 L0 自报 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB18.6
显存总量
样本量3
复现次数0
硬件Apple M3 Max · 128G 统一内存
模型deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
量化Q8_0
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名764f300d09d597a24173d05e6df8f4bcd0918e16497f537f3f25a40a87eca18f
复现链
窄屏隐藏的列
框架llama.cpp b5980
prefill tok/s539
TTFT 冷启 ms6978
decode tok/s16.0
归一化未命中model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台知乎
抓取时间20 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

mistralai/Mistral-Nemo-Instruct-2407Q5_K_M rx_7900_grevLLM 0.6.2B站最后入库 20 小时前n=4 47.6 1665 4280 L0 自报 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB11.2
显存总量
样本量4
复现次数0
硬件rx_7900_gre
模型mistralai/Mistral-Nemo-Instruct-2407
量化Q5_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名42a57f0f46d5da4296fc076c37edb805398944a6da5a19dbb4ad397e9f0bfad4
复现链
窄屏隐藏的列
框架vLLM 0.6.2
prefill tok/s1665
TTFT 冷启 ms4280
decode tok/s47.6
归一化未命中hardware: rx_7900_gre;model: mistralai/Mistral-Nemo-Instruct-2407
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台B站
抓取时间20 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

meta-llama/Llama-3.1-8B-InstructAWQ 4-bit rx_7900_gremlx-lm 0.18.2站方自产最后入库 20 小时前n=5 77.8 2632 2655 L1 已复现 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB6.7
显存总量
样本量5
复现次数0
硬件rx_7900_gre
模型meta-llama/Llama-3.1-8B-Instruct
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名24344e7350328db45c7bd1d0d240791e5ccaf2b20e886ce462308ed9454f7983
复现链
窄屏隐藏的列
框架mlx-lm 0.18.2
prefill tok/s2632
TTFT 冷启 ms2655
decode tok/s77.8
归一化未命中hardware: rx_7900_gre;model: meta-llama/Llama-3.1-8B-Instruct
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台站方自产
抓取时间20 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

deepseek-ai/DeepSeek-R1-Distill-Qwen-14BQ4_K_M rtx_4080_supervLLM 0.6.2GitHub最后入库 20 小时前n=6 60.8 2127 4280 L0 自报 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB11.2
显存总量
样本量6
复现次数0
硬件rtx_4080_super
模型deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名c52b7e580a9d3890c98b729351b32000a27352aff6a19b0e55a1a952e77b5a05
复现链
窄屏隐藏的列
框架vLLM 0.6.2
prefill tok/s2127
TTFT 冷启 ms4280
decode tok/s60.8
归一化未命中hardware: rtx_4080_super;model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台GitHub
抓取时间20 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

meta-llama/Llama-3.1-8B-InstructAWQ 4-bit rtx_4080_supervLLM 0.6.2Reddit最后入库 20 小时前n=7 113.6 3971 2655 L0 自报 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB6.7
显存总量
样本量7
复现次数0
硬件rtx_4080_super
模型meta-llama/Llama-3.1-8B-Instruct
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名9626846c549c426d90b3aef1696c4a8c90150ed1e88a3e5da7e1d6a39688a4f9
复现链
窄屏隐藏的列
框架vLLM 0.6.2
prefill tok/s3971
TTFT 冷启 ms2655
decode tok/s113.6
归一化未命中hardware: rtx_4080_super;model: meta-llama/Llama-3.1-8B-Instruct
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台Reddit
抓取时间20 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen/Qwen2.5-7B-Instruct-GGUFAWQ 4-bit rx_7900_greExLlamaV2 0.2.5HuggingFace最后入库 20 小时前n=8 96.1 3315 2421 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB6.1
显存总量
样本量8
复现次数0
硬件rx_7900_gre
模型Qwen/Qwen2.5-7B-Instruct-GGUF
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名a26f7b740b98c923720e6b8511de64abf3d75d7377cad222c555ff5275fe4913
复现链
窄屏隐藏的列
框架ExLlamaV2 0.2.5
prefill tok/s3315
TTFT 冷启 ms2421
decode tok/s96.1
归一化未命中hardware: rx_7900_gre;model: Qwen/Qwen2.5-7B-Instruct-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台HuggingFace
抓取时间20 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

meta-llama/Llama-3.1-8B-InstructQ5_K_M Apple M3 Max · 128G 统一内存mlx-lm 0.18.2V2EX最后入库 20 小时前n=9 43.4 1469 3113 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB8.0
显存总量
样本量9
复现次数0
硬件Apple M3 Max · 128G 统一内存
模型meta-llama/Llama-3.1-8B-Instruct
量化Q5_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名a36c08a6ba2a04969c9db130f9fbc23786f1b3a8d24226d92c5aa9b12c949d5f
复现链
窄屏隐藏的列
框架mlx-lm 0.18.2
prefill tok/s1469
TTFT 冷启 ms3113
decode tok/s43.4
归一化未命中model: meta-llama/Llama-3.1-8B-Instruct
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台V2EX
抓取时间20 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen3-14BQ5_K_M apple_m2_ultraollama 0.5.1知乎最后入库 20 小时前n=10 47.1 1574 4863 L1 已复现 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB12.8
显存总量
样本量10
复现次数0
硬件apple_m2_ultra
模型Qwen3-14B
量化Q5_K_M
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名1d40cdefe27a7a47367d6d052d99e4c4def3e5c26205dda91dacce063e3757e7
复现链
窄屏隐藏的列
框架ollama 0.5.1
prefill tok/s1574
TTFT 冷启 ms4863
decode tok/s47.1
归一化未命中hardware: apple_m2_ultra
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台知乎
抓取时间20 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

microsoft/phi-4-GGUFAWQ 4-bit rx_7800_xtllama.cpp b5980B站最后入库 20 小时前n=11 47.2 1588 4061 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB10.6
显存总量
样本量11
复现次数0
硬件rx_7800_xt
模型microsoft/phi-4-GGUF
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名3f867ccabe692e7fcd15b7f55b409d21278e26d48aed1f364da092f49669026e
复现链
窄屏隐藏的列
框架llama.cpp b5980
prefill tok/s1588
TTFT 冷启 ms4061
decode tok/s47.2
归一化未命中hardware: rx_7800_xt;model: microsoft/phi-4-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台B站
抓取时间20 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

meta-llama/Llama-3.1-8B-InstructQ8_0 rx_7900_gremlx-lm 0.18.2站方自产最后入库 20 小时前n=12 41.2 1393 4322 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB11.3
显存总量
样本量12
复现次数0
硬件rx_7900_gre
模型meta-llama/Llama-3.1-8B-Instruct
量化Q8_0
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名3a2ad93d442694dd96580fb71d3b8c71ceea49b8350a2ca917c76f9d4fef6be3
复现链
窄屏隐藏的列
框架mlx-lm 0.18.2
prefill tok/s1393
TTFT 冷启 ms4322
decode tok/s41.2
归一化未命中hardware: rx_7900_gre;model: meta-llama/Llama-3.1-8B-Instruct
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台站方自产
抓取时间20 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen3-32BQ4_K_M apple_m2_ultrallama.cpp b6120GitHub最后入库 20 小时前n=13 25.8 878 8780 L2 跨框架已验证 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB23.5
显存总量
样本量13
复现次数0
硬件apple_m2_ultra
模型Qwen3-32B
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L2 跨框架已验证
测量方站方自产
配置签名3d9db31a35b19986dcf76e852bd804a0ca85848ce0cf5e2f982514f23bb072fb
复现链
窄屏隐藏的列
框架llama.cpp b6120
prefill tok/s878
TTFT 冷启 ms8780
decode tok/s25.8
归一化未命中hardware: apple_m2_ultra
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台GitHub
抓取时间20 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen3-14BQ8_0 apple_m2_ultrallama.cpp b6120Reddit最后入库 20 小时前n=14 33.3 1134 6978 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB18.6
显存总量
样本量14
复现次数0
硬件apple_m2_ultra
模型Qwen3-14B
量化Q8_0
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名07c52a35fe03de2b03cf37f9f61a129d8ef56f7ec4aa3675f61c1d25e87f38fb
复现链
窄屏隐藏的列
框架llama.cpp b6120
prefill tok/s1134
TTFT 冷启 ms6978
decode tok/s33.3
归一化未命中hardware: apple_m2_ultra
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台Reddit
抓取时间20 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen3-32BQ5_K_M Apple M3 Max · 128G 统一内存llama.cpp b5980HuggingFace最后入库 20 小时前n=15 10.6 358 10113 L1 已复现 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB27.1
显存总量
样本量15
复现次数0
硬件Apple M3 Max · 128G 统一内存
模型Qwen3-32B
量化Q5_K_M
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名145c3e1ae16df854078eeeb1eef9b690eb3299095866fc0d69c4cd33a5951f90
复现链
窄屏隐藏的列
框架llama.cpp b5980
prefill tok/s358
TTFT 冷启 ms10113
decode tok/s10.6
归一化未命中
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台HuggingFace
抓取时间20 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

导出 CSV JSON 导出当前筛选的全部命中结果(上限 500 条)

怎么读这张表

  • 证据级别不是我们自己打的标签。它由记录之间的相互验证推导:同一三元组被第三方用不同框架 跑出接近的数字,才升到 L1;跨框架也对得上,才是 L2。站方自产的记录即使带签名,在别人复现之前 仍然是 L0。
  • 没有样本量的数字不显示。一行就是一个样本集,四个指标同源;样本量缺失时整行数字渲染 ,因为一个没有 n 的统计值不该被当成结论。
  • 「跑不动」和「没有数据」是两回事。前者是有证据表明显存不够,后者是我们还没收录这个组合 ——把后者读成前者,就是拿机器的沉默冒充人的结论。
  • 导出的上限是服务端强制的。当前视图最多导出 500 行;程序化取全量请走 API
数据 CC BY 4.0 · 可被 AI 引用 复现 ≠ 点赞 来源:GitHub · Reddit · HuggingFace · 站方自产 方法与边界 投稿指南 API RSS