跑得动araoai.com
投稿
搜什么 常用 72 条 Run · 7 个模型 · 10 个硬件型号
全量数据

每一条实测记录,都能追到来源

这是库里的全部实测记录,不是精选。筛选条件写在网址里,所以你复制出去的链接就是你看到的这一屏。 每条记录都标着证据级别:L0 是自报,L1 被第三方复现过,L2 还跨了框架。

重置
证据 全部L1 及以上L2 跨框架 入库时间 近 7 天近 30 天全部 命中 72

实测记录

筛选命中 72 条 · 第 1/2 页 · 本页 50 条

模型 / 量化 decodetok/s prefilltok/s TTFTms 显存峰值GB 证据 复现链 状态
Qwen3-14BQ5_K_M NVIDIA RTX 4090 · 24Gmlx-lm 0.18.2Reddit最后入库 18 小时前n=4 62.5 2115 4863 L0 自报 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB12.8
显存总量
样本量4
复现次数0
硬件NVIDIA RTX 4090 · 24G
模型Qwen3-14B
量化Q5_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名f8d057a2d14a13cf646c9ff4e891c5efb5225efb6bb20fb08e802cb5a91814e2
复现链
窄屏隐藏的列
框架mlx-lm 0.18.2
prefill tok/s2115
TTFT 冷启 ms4863
decode tok/s62.5
归一化未命中
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台Reddit
抓取时间18 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

meta-llama/Llama-3.1-8B-InstructQ8_0 Apple M3 Max · 128G 统一内存vLLM 0.6.2HuggingFace最后入库 18 小时前n=5 32.7 1142 4322 L1 已复现 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB11.3
显存总量
样本量5
复现次数0
硬件Apple M3 Max · 128G 统一内存
模型meta-llama/Llama-3.1-8B-Instruct
量化Q8_0
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名79b2a51fcd3d178d1ee5d2070e329d3c7d87f872c24c0e50788a3e6c9881e436
复现链
窄屏隐藏的列
框架vLLM 0.6.2
prefill tok/s1142
TTFT 冷启 ms4322
decode tok/s32.7
归一化未命中model: meta-llama/Llama-3.1-8B-Instruct
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台HuggingFace
抓取时间18 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

deepseek-ai/DeepSeek-R1-Distill-Qwen-14BQ4_K_M rtx_3060ExLlamaV2 0.2.5V2EX最后入库 18 小时前n=6 28.2 971 4280 L0 自报 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB11.2
显存总量
样本量6
复现次数0
硬件rtx_3060
模型deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名d290bbf297d934829b28a3863e97a89f4031890ad54ff9d8fd8eb729e0270cd8
复现链
窄屏隐藏的列
框架ExLlamaV2 0.2.5
prefill tok/s971
TTFT 冷启 ms4280
decode tok/s28.2
归一化未命中hardware: rtx_3060;model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台V2EX
抓取时间18 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen/Qwen2.5-7B-Instruct-GGUFAWQ 4-bit Apple M3 Max · 128G 统一内存vLLM 0.6.2知乎最后入库 18 小时前n=7 70.5 2466 2421 L2 跨框架已验证 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB6.1
显存总量
样本量7
复现次数0
硬件Apple M3 Max · 128G 统一内存
模型Qwen/Qwen2.5-7B-Instruct-GGUF
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L2 跨框架已验证
测量方站方自产
配置签名1a7de696fb9be50cf2e6941e9361aaf080c9732e74b19a0278b6153b0e7e76e2
复现链
窄屏隐藏的列
框架vLLM 0.6.2
prefill tok/s2466
TTFT 冷启 ms2421
decode tok/s70.5
归一化未命中model: Qwen/Qwen2.5-7B-Instruct-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台知乎
抓取时间18 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

mistralai/Mistral-Nemo-Instruct-2407Q5_K_M NVIDIA RTX 4090 · 24Gllama.cpp b6120B站最后入库 18 小时前n=8 74.4 2530 4280 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB11.2
显存总量
样本量8
复现次数0
硬件NVIDIA RTX 4090 · 24G
模型mistralai/Mistral-Nemo-Instruct-2407
量化Q5_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名dc06305575597c738c00af581cdcebb636136ef0f80be667340345583fefbb3d
复现链
窄屏隐藏的列
框架llama.cpp b6120
prefill tok/s2530
TTFT 冷启 ms4280
decode tok/s74.4
归一化未命中model: mistralai/Mistral-Nemo-Instruct-2407
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台B站
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

microsoft/phi-4-GGUFQ4_K_M rx_7900_greExLlamaV2 0.2.5站方自产最后入库 18 小时前n=9 45.1 1554 4280 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB11.2
显存总量
样本量9
复现次数0
硬件rx_7900_gre
模型microsoft/phi-4-GGUF
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名b9a961d60ca85bc6ea88685f5e01e04e803341719356a6c26ac84ee231dd64ac
复现链
窄屏隐藏的列
框架ExLlamaV2 0.2.5
prefill tok/s1554
TTFT 冷启 ms4280
decode tok/s45.1
归一化未命中hardware: rx_7900_gre;model: microsoft/phi-4-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台站方自产
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

microsoft/phi-4-GGUFQ6_K NVIDIA RTX 3090 · 24Gllama.cpp b5980GitHub最后入库 18 小时前n=10 48.2 1625 5592 L1 已复现 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB14.8
显存总量
样本量10
复现次数0
硬件NVIDIA RTX 3090 · 24G
模型microsoft/phi-4-GGUF
量化Q6_K
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名0d37268c8af4fb95412ad26534751d6624580de7b999fedf27df41f2077eb8d0
复现链
窄屏隐藏的列
框架llama.cpp b5980
prefill tok/s1625
TTFT 冷启 ms5592
decode tok/s48.2
归一化未命中model: microsoft/phi-4-GGUF;quant: Q6_K
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台GitHub
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

microsoft/phi-4-GGUFQ5_K_M rtx_4080_superollama 0.5.1Reddit最后入库 18 小时前n=11 43.3 1448 4863 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB12.8
显存总量
样本量11
复现次数0
硬件rtx_4080_super
模型microsoft/phi-4-GGUF
量化Q5_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名5fcb7c2c530a1cd9eba821f8a118e94f29d1c9629e0c6e0e9b8049afb0881ab7
复现链
窄屏隐藏的列
框架ollama 0.5.1
prefill tok/s1448
TTFT 冷启 ms4863
decode tok/s43.3
归一化未命中hardware: rtx_4080_super;model: microsoft/phi-4-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台Reddit
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen3-14BQ8_0 Apple M3 Max · 128G 统一内存ollama 0.5.1HuggingFace最后入库 18 小时前n=12 15.5 519 6978 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB18.6
显存总量
样本量12
复现次数0
硬件Apple M3 Max · 128G 统一内存
模型Qwen3-14B
量化Q8_0
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名91e6f13f927ccf9c42828d601c6177eadc8b0ec71a5fbfe1245ea23890945a93
复现链
窄屏隐藏的列
框架ollama 0.5.1
prefill tok/s519
TTFT 冷启 ms6978
decode tok/s15.5
归一化未命中
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台HuggingFace
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

mistralai/Mistral-Nemo-Instruct-2407Q4_K_M apple_m2_ultraExLlamaV2 0.2.5V2EX最后入库 18 小时前n=13 73.0 2518 3780 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB9.8
显存总量
样本量13
复现次数0
硬件apple_m2_ultra
模型mistralai/Mistral-Nemo-Instruct-2407
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名5e7815c8dea0112b216fd07bc0c12c814c08711d452e384f2adcdedf36d7e601
复现链
窄屏隐藏的列
框架ExLlamaV2 0.2.5
prefill tok/s2518
TTFT 冷启 ms3780
decode tok/s73.0
归一化未命中hardware: apple_m2_ultra;model: mistralai/Mistral-Nemo-Instruct-2407
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台V2EX
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

microsoft/phi-4-GGUFQ4_K_M NVIDIA RTX 3090 · 24GExLlamaV2 0.2.5知乎最后入库 18 小时前n=14 73.2 2525 4280 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB11.2
显存总量
样本量14
复现次数0
硬件NVIDIA RTX 3090 · 24G
模型microsoft/phi-4-GGUF
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名dbeda0143f3870720be9576edf01d6d5b84ed2ce3c600a27d85bfc7b91628a9d
复现链
窄屏隐藏的列
框架ExLlamaV2 0.2.5
prefill tok/s2525
TTFT 冷启 ms4280
decode tok/s73.2
归一化未命中model: microsoft/phi-4-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台知乎
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen3-32BQ4_K_M Apple M3 Max · 128G 统一内存llama.cpp b6120B站最后入库 18 小时前n=15 12.9 439 8780 L1 已复现 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB23.5
显存总量
样本量15
复现次数0
硬件Apple M3 Max · 128G 统一内存
模型Qwen3-32B
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名a648db8efc305f6c447e86acdd56df39f2ec03c7d15fd2fa39a4c5abbe64c14a
复现链
窄屏隐藏的列
框架llama.cpp b6120
prefill tok/s439
TTFT 冷启 ms8780
decode tok/s12.9
归一化未命中
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台B站
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen/Qwen2.5-7B-Instruct-GGUFQ4_K_M AMD Radeon RX 7900 XTX · 24Gmlx-lm 0.18.2站方自产最后入库 18 小时前n=16 138.9 4700 2530 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB6.4
显存总量
样本量16
复现次数0
硬件AMD Radeon RX 7900 XTX · 24G
模型Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名fde48cbd91e29cd521e50ef7365db8a3e6a27a2b0ac0efcce5c51217c6d85f56
复现链
窄屏隐藏的列
框架mlx-lm 0.18.2
prefill tok/s4700
TTFT 冷启 ms2530
decode tok/s138.9
归一化未命中model: Qwen/Qwen2.5-7B-Instruct-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台站方自产
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen/Qwen2.5-7B-Instruct-GGUFQ8_0 rx_7800_xtmlx-lm 0.18.2GitHub最后入库 18 小时前n=17 51.0 1725 3879 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB10.1
显存总量
样本量17
复现次数0
硬件rx_7800_xt
模型Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q8_0
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名d4e955142aac74018431a2748e182600b79d212ac3de897f04ffd5063c55abcb
复现链
窄屏隐藏的列
框架mlx-lm 0.18.2
prefill tok/s1725
TTFT 冷启 ms3879
decode tok/s51.0
归一化未命中hardware: rx_7800_xt;model: Qwen/Qwen2.5-7B-Instruct-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台GitHub
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen/Qwen2.5-7B-Instruct-GGUFAWQ 4-bit AMD Radeon RX 7900 XTX · 24GvLLM 0.6.2Reddit最后入库 18 小时前n=3 169.3 5919 2421 L2 跨框架已验证 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB6.1
显存总量
样本量3
复现次数0
硬件AMD Radeon RX 7900 XTX · 24G
模型Qwen/Qwen2.5-7B-Instruct-GGUF
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L2 跨框架已验证
测量方站方自产
配置签名e41d5dd004847cf6ef7666b0d0857270dbed7957056a850b86fca5537a6a75b0
复现链
窄屏隐藏的列
框架vLLM 0.6.2
prefill tok/s5919
TTFT 冷启 ms2421
decode tok/s169.3
归一化未命中model: Qwen/Qwen2.5-7B-Instruct-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台Reddit
抓取时间18 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen/Qwen2.5-7B-Instruct-GGUFQ5_K_M rtx_3060mlx-lm 0.18.2HuggingFace最后入库 18 小时前n=4 44.6 1511 2822 L0 自报 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB7.2
显存总量
样本量4
复现次数0
硬件rtx_3060
模型Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q5_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名cd2c5f23c36b902a5db2cedb5a78fc6447f70ccccbe3b3d6fe10566e7f13b139
复现链
窄屏隐藏的列
框架mlx-lm 0.18.2
prefill tok/s1511
TTFT 冷启 ms2822
decode tok/s44.6
归一化未命中hardware: rtx_3060;model: Qwen/Qwen2.5-7B-Instruct-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台HuggingFace
抓取时间18 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen/Qwen2.5-7B-Instruct-GGUFQ4_K_M apple_m2_ultraollama 0.5.1V2EX最后入库 18 小时前n=5 109.8 3673 2530 L1 已复现 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB6.4
显存总量
样本量5
复现次数0
硬件apple_m2_ultra
模型Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名c1d6865a182b23e79a00778e5549b57f89580f646eb7ce4523d67b907527de20
复现链
窄屏隐藏的列
框架ollama 0.5.1
prefill tok/s3673
TTFT 冷启 ms2530
decode tok/s109.8
归一化未命中hardware: apple_m2_ultra;model: Qwen/Qwen2.5-7B-Instruct-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台V2EX
抓取时间18 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

mistralai/Mistral-Nemo-Instruct-2407AWQ 4-bit rx_7900_greExLlamaV2 0.2.5知乎最后入库 18 小时前n=6 56.1 1934 3592 L0 自报 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB9.3
显存总量
样本量6
复现次数0
硬件rx_7900_gre
模型mistralai/Mistral-Nemo-Instruct-2407
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名2cb4121bb90a4491b2de79720d4b9905e80ef962041046a6745e67ec0df34fe4
复现链
窄屏隐藏的列
框架ExLlamaV2 0.2.5
prefill tok/s1934
TTFT 冷启 ms3592
decode tok/s56.1
归一化未命中hardware: rx_7900_gre;model: mistralai/Mistral-Nemo-Instruct-2407
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台知乎
抓取时间18 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

microsoft/phi-4-GGUFAWQ 4-bit arc_a770vLLM 0.6.2B站最后入库 18 小时前n=7 49.4 1726 4061 L0 自报 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB10.6
显存总量
样本量7
复现次数0
硬件arc_a770
模型microsoft/phi-4-GGUF
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名ff90f98d8c4bfa8329a64837fb26d0937c199f1be2ea4c14d9bd14ef4b8d076d
复现链
窄屏隐藏的列
框架vLLM 0.6.2
prefill tok/s1726
TTFT 冷启 ms4061
decode tok/s49.4
归一化未命中hardware: arc_a770;model: microsoft/phi-4-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台B站
抓取时间18 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

meta-llama/Llama-3.1-8B-InstructQ5_K_M arc_a770ExLlamaV2 0.2.5站方自产最后入库 18 小时前n=8 65.7 2266 3113 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB8.0
显存总量
样本量8
复现次数0
硬件arc_a770
模型meta-llama/Llama-3.1-8B-Instruct
量化Q5_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名fdc5e3d3a660a055500c7ab1dabb0a81425698f39ae61057bfc67db14d922209
复现链
窄屏隐藏的列
框架ExLlamaV2 0.2.5
prefill tok/s2266
TTFT 冷启 ms3113
decode tok/s65.7
归一化未命中hardware: arc_a770;model: meta-llama/Llama-3.1-8B-Instruct
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台站方自产
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen3-14BQ4_K_M rtx_4080_supermlx-lm 0.18.2GitHub最后入库 18 小时前n=9 53.2 1802 4280 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB11.2
显存总量
样本量9
复现次数0
硬件rtx_4080_super
模型Qwen3-14B
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名ed5af2df4877b8f814eb746143c18ba46282c981ed1ec5abb91dafa5f4fac266
复现链
窄屏隐藏的列
框架mlx-lm 0.18.2
prefill tok/s1802
TTFT 冷启 ms4280
decode tok/s53.2
归一化未命中hardware: rtx_4080_super
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台GitHub
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen/Qwen2.5-7B-Instruct-GGUFFP16 apple_m2_ultramlx-lm 0.18.2Reddit最后入库 18 小时前n=10 34.7 1175 6613 L1 已复现 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB17.6
显存总量
样本量10
复现次数0
硬件apple_m2_ultra
模型Qwen/Qwen2.5-7B-Instruct-GGUF
量化FP16
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名863a8d833495a4be2a524f568758c0784faee6af1f5bcf6f87aa8adbf4131372
复现链
窄屏隐藏的列
框架mlx-lm 0.18.2
prefill tok/s1175
TTFT 冷启 ms6613
decode tok/s34.7
归一化未命中hardware: apple_m2_ultra;model: Qwen/Qwen2.5-7B-Instruct-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台Reddit
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

meta-llama/Llama-3.1-8B-InstructAWQ 4-bit arc_a770llama.cpp b5980HuggingFace最后入库 18 小时前n=11 74.1 2495 2655 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB6.7
显存总量
样本量11
复现次数0
硬件arc_a770
模型meta-llama/Llama-3.1-8B-Instruct
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名1503ba0450d81cfd67c9a4c8ddf80b0f97b0b21e66170bf59f33f563ae624012
复现链
窄屏隐藏的列
框架llama.cpp b5980
prefill tok/s2495
TTFT 冷启 ms2655
decode tok/s74.1
归一化未命中hardware: arc_a770;model: meta-llama/Llama-3.1-8B-Instruct
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台HuggingFace
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

microsoft/phi-4-GGUFAWQ 4-bit Apple M3 Max · 128G 统一内存llama.cpp b5980V2EX最后入库 18 小时前n=12 30.2 1018 4061 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB10.6
显存总量
样本量12
复现次数0
硬件Apple M3 Max · 128G 统一内存
模型microsoft/phi-4-GGUF
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名d45dbfa14ac99eb3c0d5c75a28caf47088405ca61d5501954d1fc292b24fafa5
复现链
窄屏隐藏的列
框架llama.cpp b5980
prefill tok/s1018
TTFT 冷启 ms4061
decode tok/s30.2
归一化未命中model: microsoft/phi-4-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台V2EX
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen/Qwen2.5-7B-Instruct-GGUFAWQ 4-bit rtx_4080_supermlx-lm 0.18.2知乎最后入库 18 小时前n=13 113.6 3843 2421 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB6.1
显存总量
样本量13
复现次数0
硬件rtx_4080_super
模型Qwen/Qwen2.5-7B-Instruct-GGUF
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名be7789e8b98bbb9868eebd6f4532dccb2e2eeef325215476eee9f9e99fc22d71
复现链
窄屏隐藏的列
框架mlx-lm 0.18.2
prefill tok/s3843
TTFT 冷启 ms2421
decode tok/s113.6
归一化未命中hardware: rtx_4080_super;model: Qwen/Qwen2.5-7B-Instruct-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台知乎
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen/Qwen2.5-7B-Instruct-GGUFQ6_K apple_m2_ultraExLlamaV2 0.2.5B站最后入库 18 小时前n=14 91.0 3139 3186 L2 跨框架已验证 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB8.2
显存总量
样本量14
复现次数0
硬件apple_m2_ultra
模型Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q6_K
投机解码
并发数
上下文扩展
证据级别L2 跨框架已验证
测量方站方自产
配置签名3a70dab39c6caeb6a1382ed620aef5bce10a646a6254f82c045e2df9e869fa13
复现链
窄屏隐藏的列
框架ExLlamaV2 0.2.5
prefill tok/s3139
TTFT 冷启 ms3186
decode tok/s91.0
归一化未命中hardware: apple_m2_ultra;model: Qwen/Qwen2.5-7B-Instruct-GGUF;quant: Q6_K
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台B站
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

meta-llama/Llama-3.1-8B-InstructQ4_K_M rx_7800_xtExLlamaV2 0.2.5站方自产最后入库 18 小时前n=15 85.4 2946 2780 L1 已复现 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB7.1
显存总量
样本量15
复现次数0
硬件rx_7800_xt
模型meta-llama/Llama-3.1-8B-Instruct
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名96c0a37d078bfd35ff8a62d16541325fc9dfd3a0f0cf26d24e4cb0ae5e8f2245
复现链
窄屏隐藏的列
框架ExLlamaV2 0.2.5
prefill tok/s2946
TTFT 冷启 ms2780
decode tok/s85.4
归一化未命中hardware: rx_7800_xt;model: meta-llama/Llama-3.1-8B-Instruct
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台站方自产
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

deepseek-ai/DeepSeek-R1-Distill-Qwen-14BQ4_K_M arc_a770llama.cpp b5980GitHub最后入库 18 小时前n=16 39.7 1336 4280 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB11.2
显存总量
样本量16
复现次数0
硬件arc_a770
模型deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名8a25fa34372c2d95a86a0882b0f8f930309657f78c38280f66a55877359a06db
复现链
窄屏隐藏的列
框架llama.cpp b5980
prefill tok/s1336
TTFT 冷启 ms4280
decode tok/s39.7
归一化未命中hardware: arc_a770;model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台GitHub
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

meta-llama/Llama-3.1-8B-InstructQ6_K rx_7900_grevLLM 0.6.2Reddit最后入库 18 小时前n=17 60.6 2119 3530 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB9.1
显存总量
样本量17
复现次数0
硬件rx_7900_gre
模型meta-llama/Llama-3.1-8B-Instruct
量化Q6_K
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名b1a65b266b849eaede1b133de96bfa2d0740110f9468022f103b100543a7884a
复现链
窄屏隐藏的列
框架vLLM 0.6.2
prefill tok/s2119
TTFT 冷启 ms3530
decode tok/s60.6
归一化未命中hardware: rx_7900_gre;model: meta-llama/Llama-3.1-8B-Instruct;quant: Q6_K
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台Reddit
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

mistralai/Mistral-Nemo-Instruct-2407Q4_K_M NVIDIA RTX 4090 · 24Gollama 0.5.1HuggingFace最后入库 18 小时前n=3 80.7 2699 3780 L0 自报 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB9.8
显存总量
样本量3
复现次数0
硬件NVIDIA RTX 4090 · 24G
模型mistralai/Mistral-Nemo-Instruct-2407
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名578f239858a1f7ab83dc89bf0005d5bad1b7ddd82109114e03807e268d4553d9
复现链
窄屏隐藏的列
框架ollama 0.5.1
prefill tok/s2699
TTFT 冷启 ms3780
decode tok/s80.7
归一化未命中model: mistralai/Mistral-Nemo-Instruct-2407
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台HuggingFace
抓取时间18 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen3-14BFP16 apple_m2_ultrallama.cpp b6120V2EX最后入库 18 小时前n=4 17.7 602 12447 L0 自报 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB33.5
显存总量
样本量4
复现次数0
硬件apple_m2_ultra
模型Qwen3-14B
量化FP16
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名f7d03a6008c47078420883a00a11f904b00b779e8dd4ade64366824447a74c1d
复现链
窄屏隐藏的列
框架llama.cpp b6120
prefill tok/s602
TTFT 冷启 ms12447
decode tok/s17.7
归一化未命中hardware: apple_m2_ultra
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台V2EX
抓取时间18 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

deepseek-ai/DeepSeek-R1-Distill-Qwen-14BQ4_K_M NVIDIA RTX 3090 · 24Gllama.cpp b5980知乎最后入库 18 小时前n=5 66.3 2234 4280 L1 已复现 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB11.2
显存总量
样本量5
复现次数0
硬件NVIDIA RTX 3090 · 24G
模型deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名5b731bde756c87f7f6c0332d756a28d45f3c34fca39ac0632fea934fc2242ae2
复现链
窄屏隐藏的列
框架llama.cpp b5980
prefill tok/s2234
TTFT 冷启 ms4280
decode tok/s66.3
归一化未命中model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台知乎
抓取时间18 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen/Qwen2.5-7B-Instruct-GGUFQ5_K_M Apple M3 Max · 128G 统一内存ollama 0.5.1B站最后入库 18 小时前n=6 47.1 1574 2822 L0 自报 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB7.2
显存总量
样本量6
复现次数0
硬件Apple M3 Max · 128G 统一内存
模型Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q5_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名e0f498c76541adfdf99f80e6ae98008c09f495e427ee0402d287f0eda3cb31df
复现链
窄屏隐藏的列
框架ollama 0.5.1
prefill tok/s1574
TTFT 冷启 ms2822
decode tok/s47.1
归一化未命中model: Qwen/Qwen2.5-7B-Instruct-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台B站
抓取时间18 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen3-14BQ6_K rtx_4080_superllama.cpp b6120站方自产最后入库 18 小时前n=7 39.5 1343 5592 L0 自报 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB14.8
显存总量
样本量7
复现次数0
硬件rtx_4080_super
模型Qwen3-14B
量化Q6_K
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名77858a52a0ab50ea306df8ee13c9f8ef532deea8421b3d89673bbbed1a964f34
复现链
窄屏隐藏的列
框架llama.cpp b6120
prefill tok/s1343
TTFT 冷启 ms5592
decode tok/s39.5
归一化未命中hardware: rtx_4080_super;quant: Q6_K
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台站方自产
抓取时间18 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

deepseek-ai/DeepSeek-R1-Distill-Qwen-14BAWQ 4-bit rx_7800_xtmlx-lm 0.18.2GitHub最后入库 18 小时前n=8 48.1 1629 4061 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB10.6
显存总量
样本量8
复现次数0
硬件rx_7800_xt
模型deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名49735fc1da931d49688f4b5fcb27822442fe696220c7ab971d1e250459b2e855
复现链
窄屏隐藏的列
框架mlx-lm 0.18.2
prefill tok/s1629
TTFT 冷启 ms4061
decode tok/s48.1
归一化未命中hardware: rx_7800_xt;model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台GitHub
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen3-14BQ4_K_M NVIDIA RTX 3090 · 24Gmlx-lm 0.18.2Reddit最后入库 18 小时前n=9 67.7 2291 4280 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB11.2
显存总量
样本量9
复现次数0
硬件NVIDIA RTX 3090 · 24G
模型Qwen3-14B
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名ebe0fe95c6d59f1aca1dc6a6645982c8af670295aee68143100b375927f5d6da
复现链
窄屏隐藏的列
框架mlx-lm 0.18.2
prefill tok/s2291
TTFT 冷启 ms4280
decode tok/s67.7
归一化未命中
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台Reddit
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

deepseek-ai/DeepSeek-R1-Distill-Qwen-14BFP16 Apple M3 Max · 128G 统一内存mlx-lm 0.18.2HuggingFace最后入库 18 小时前n=10 8.7 294 12447 L1 已复现 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB33.5
显存总量
样本量10
复现次数0
硬件Apple M3 Max · 128G 统一内存
模型deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
量化FP16
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名89de7107f9cc4bb67c7fbf5fa95b917e19fc07e78f4b6b1949c54e3d26053de9
复现链
窄屏隐藏的列
框架mlx-lm 0.18.2
prefill tok/s294
TTFT 冷启 ms12447
decode tok/s8.7
归一化未命中model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台HuggingFace
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

meta-llama/Llama-3.1-8B-InstructQ5_K_M NVIDIA RTX 3090 · 24GExLlamaV2 0.2.5V2EX最后入库 18 小时前n=11 109.8 3788 3113 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB8.0
显存总量
样本量11
复现次数0
硬件NVIDIA RTX 3090 · 24G
模型meta-llama/Llama-3.1-8B-Instruct
量化Q5_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名e5593bd287bc0b1952315cfaa1b5dd64eb27128aaca38679ba28c0f2171482b7
复现链
窄屏隐藏的列
框架ExLlamaV2 0.2.5
prefill tok/s3788
TTFT 冷启 ms3113
decode tok/s109.8
归一化未命中model: meta-llama/Llama-3.1-8B-Instruct
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台V2EX
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen/Qwen2.5-7B-Instruct-GGUFQ8_0 NVIDIA RTX 3090 · 24Gllama.cpp b6120知乎最后入库 18 小时前n=12 78.0 2653 3879 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB10.1
显存总量
样本量12
复现次数0
硬件NVIDIA RTX 3090 · 24G
模型Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q8_0
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名41b2798edf5d0ac7911125dda81092b27cea87a2936a7e06501195a8a70489ed
复现链
窄屏隐藏的列
框架llama.cpp b6120
prefill tok/s2653
TTFT 冷启 ms3879
decode tok/s78.0
归一化未命中model: Qwen/Qwen2.5-7B-Instruct-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台知乎
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen/Qwen2.5-7B-Instruct-GGUFQ4_K_M arc_a770ExLlamaV2 0.2.5B站最后入库 18 小时前n=13 87.6 3021 2530 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB6.4
显存总量
样本量13
复现次数0
硬件arc_a770
模型Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名0c0dcf89cb13c73d5e0d949a84ac781af21263f3f0bc0a4a1bdb88bb7d1c458f
复现链
窄屏隐藏的列
框架ExLlamaV2 0.2.5
prefill tok/s3021
TTFT 冷启 ms2530
decode tok/s87.6
归一化未命中hardware: arc_a770;model: Qwen/Qwen2.5-7B-Instruct-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台B站
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

microsoft/phi-4-GGUFQ4_K_M Apple M3 Max · 128G 统一内存mlx-lm 0.18.2站方自产最后入库 18 小时前n=14 28.9 979 4280 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB11.2
显存总量
样本量14
复现次数0
硬件Apple M3 Max · 128G 统一内存
模型microsoft/phi-4-GGUF
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名a805611a6dd968bf8e8ecbf1e5f4dfee54eb01ed47b4a098fa38a46696ff746b
复现链
窄屏隐藏的列
框架mlx-lm 0.18.2
prefill tok/s979
TTFT 冷启 ms4280
decode tok/s28.9
归一化未命中model: microsoft/phi-4-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台站方自产
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen3-14BQ6_K rtx_4080_superollama 0.5.1GitHub最后入库 18 小时前n=15 36.7 1229 5592 L1 已复现 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB14.8
显存总量
样本量15
复现次数0
硬件rtx_4080_super
模型Qwen3-14B
量化Q6_K
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名effd3db70d7240f2e0e8ccc42655b784c09d028026dc2c077013f5fdee37dedb
复现链
窄屏隐藏的列
框架ollama 0.5.1
prefill tok/s1229
TTFT 冷启 ms5592
decode tok/s36.7
归一化未命中hardware: rtx_4080_super;quant: Q6_K
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台GitHub
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen/Qwen2.5-7B-Instruct-GGUFAWQ 4-bit NVIDIA RTX 4090 · 24Gmlx-lm 0.18.2Reddit最后入库 18 小时前n=16 155.5 5264 2421 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB6.1
显存总量
样本量16
复现次数0
硬件NVIDIA RTX 4090 · 24G
模型Qwen/Qwen2.5-7B-Instruct-GGUF
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名2c8cd459a02a18feee4db4d82ebfdf72e360a2c402fe969e6e8c78934df5e5ce
复现链
窄屏隐藏的列
框架mlx-lm 0.18.2
prefill tok/s5264
TTFT 冷启 ms2421
decode tok/s155.5
归一化未命中model: Qwen/Qwen2.5-7B-Instruct-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台Reddit
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen/Qwen2.5-7B-Instruct-GGUFQ6_K NVIDIA RTX 3090 · 24Gollama 0.5.1HuggingFace最后入库 18 小时前n=17 93.5 3125 3186 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB8.2
显存总量
样本量17
复现次数0
硬件NVIDIA RTX 3090 · 24G
模型Qwen/Qwen2.5-7B-Instruct-GGUF
量化Q6_K
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名0d1c4eaea61939cc9f5232fa75f1261b2f933747f25e5916d168f56671d56b28
复现链
窄屏隐藏的列
框架ollama 0.5.1
prefill tok/s3125
TTFT 冷启 ms3186
decode tok/s93.5
归一化未命中model: Qwen/Qwen2.5-7B-Instruct-GGUF;quant: Q6_K
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台HuggingFace
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

mistralai/Mistral-Nemo-Instruct-2407Q4_K_M rtx_3060llama.cpp b6120V2EX最后入库 18 小时前n=3 31.0 1054 3780 L0 自报 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB9.8
显存总量
样本量3
复现次数0
硬件rtx_3060
模型mistralai/Mistral-Nemo-Instruct-2407
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名8095a863c88e3f62c132b0b07bc2290f6bab813906285ac77468a859efe76219
复现链
窄屏隐藏的列
框架llama.cpp b6120
prefill tok/s1054
TTFT 冷启 ms3780
decode tok/s31.0
归一化未命中hardware: rtx_3060;model: mistralai/Mistral-Nemo-Instruct-2407
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台V2EX
抓取时间18 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen3-14BQ4_K_M rtx_4080_superExLlamaV2 0.2.5知乎最后入库 18 小时前n=4 57.6 1986 4280 L0 自报 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB11.2
显存总量
样本量4
复现次数0
硬件rtx_4080_super
模型Qwen3-14B
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名59547370d33c48bac963bafd39b90ad6153c659691b23964eea5870ef41a47ac
复现链
窄屏隐藏的列
框架ExLlamaV2 0.2.5
prefill tok/s1986
TTFT 冷启 ms4280
decode tok/s57.6
归一化未命中hardware: rtx_4080_super
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台知乎
抓取时间18 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

deepseek-ai/DeepSeek-R1-Distill-Qwen-14BAWQ 4-bit rx_7900_greollama 0.5.1B站最后入库 18 小时前n=5 42.2 1410 4061 L1 已复现 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB10.6
显存总量
样本量5
复现次数0
硬件rx_7900_gre
模型deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L1 已复现
测量方站方自产
配置签名90f5ca07fef974cba06a44a8aafb08762cd01056de1dbd4d0683c35e074b412e
复现链
窄屏隐藏的列
框架ollama 0.5.1
prefill tok/s1410
TTFT 冷启 ms4061
decode tok/s42.2
归一化未命中hardware: rx_7900_gre;model: deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台B站
抓取时间18 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen3-14BQ4_K_M rtx_3060vLLM 0.6.2站方自产最后入库 18 小时前n=6 29.8 1040 4280 L2 跨框架已验证 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB11.2
显存总量
样本量6
复现次数0
硬件rtx_3060
模型Qwen3-14B
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L2 跨框架已验证
测量方站方自产
配置签名f670d6feb01d2e7489c729c33329162cd33f08650806f6a30284856fc2fd171c
复现链
窄屏隐藏的列
框架vLLM 0.6.2
prefill tok/s1040
TTFT 冷启 ms4280
decode tok/s29.8
归一化未命中hardware: rtx_3060
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台站方自产
抓取时间18 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen3-14BQ4_K_M rx_7900_gremlx-lm 0.18.2GitHub最后入库 18 小时前n=7 41.7 1410 4280 L0 自报 待复现 待复现
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB11.2
显存总量
样本量7
复现次数0
硬件rx_7900_gre
模型Qwen3-14B
量化Q4_K_M
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名80684a4188cc8b6cbbbdd266e26ffb1abadd9c4240b0f40bcc3b4a63520d5e2e
复现链
窄屏隐藏的列
框架mlx-lm 0.18.2
prefill tok/s1410
TTFT 冷启 ms4280
decode tok/s41.7
归一化未命中hardware: rx_7900_gre
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台GitHub
抓取时间18 小时前
状态待复现
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「待复现」只有一次或单一来源的读数,还没等到独立复现。数字照常可用,但按 L0/L1 对待。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

Qwen3-14BAWQ 4-bit rx_7900_gremlx-lm 0.18.2Reddit最后入库 18 小时前n=8 44.4 1504 4061 L0 自报 待复现 稳定
完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB10.6
显存总量
样本量8
复现次数0
硬件rx_7900_gre
模型Qwen3-14B
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名547e590cc6d4c005ef0af9c4d1c308dc2013bfbd07d4c455bbd3b9f7084978ce
复现链
窄屏隐藏的列
框架mlx-lm 0.18.2
prefill tok/s1504
TTFT 冷启 ms4061
decode tok/s44.4
归一化未命中hardware: rx_7900_gre
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台Reddit
抓取时间18 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

导出 CSV JSON 导出当前筛选的全部命中结果(上限 500 条)

怎么读这张表

  • 证据级别不是我们自己打的标签。它由记录之间的相互验证推导:同一三元组被第三方用不同框架 跑出接近的数字,才升到 L1;跨框架也对得上,才是 L2。站方自产的记录即使带签名,在别人复现之前 仍然是 L0。
  • 没有样本量的数字不显示。一行就是一个样本集,四个指标同源;样本量缺失时整行数字渲染 ,因为一个没有 n 的统计值不该被当成结论。
  • 「跑不动」和「没有数据」是两回事。前者是有证据表明显存不够,后者是我们还没收录这个组合 ——把后者读成前者,就是拿机器的沉默冒充人的结论。
  • 导出的上限是服务端强制的。当前视图最多导出 500 行;程序化取全量请走 API
数据 CC BY 4.0 · 可被 AI 引用 复现 ≠ 点赞 来源:GitHub · Reddit · HuggingFace · 站方自产 方法与边界 投稿指南 API RSS