跑得动araoai.com
投稿
搜什么 常用 72 条 Run · 7 个模型 · 10 个硬件型号
单条实测记录

microsoft/phi-4-GGUF · AWQ 4-bit

在 Apple M3 Max · 128G 统一内存 上, 用 ollama 0.5.1 跑出来的读数。 下面每一项都来自这条记录本身——我们没有替它补过任何字段。

L0 自报 稳定 最后入库 20 小时前 记录号 pipeline-run-51

这条记录的全部字段

的意思是来源没说这一项——不是「关」,也不是「0」。 记录里没有的字段我们也列出来,那样你才看得出这是我们的缺口,而不是这一页不问它。

完整配置
上下文长度
KV cache
flash attention
batch
GPU 层数-1
显存峰值 GB10.6
显存总量
样本量9
复现次数0
硬件Apple M3 Max · 128G 统一内存
模型microsoft/phi-4-GGUF
量化AWQ 4-bit
投机解码
并发数
上下文扩展
证据级别L0 自报
测量方站方自产
配置签名0433b15e9e706cdc286ccf75de47656c8dad78e85ef942824c51eec016be5d7e
复现链
窄屏隐藏的列
框架ollama 0.5.1
prefill tok/s979
TTFT 冷启 ms4061
decode tok/s29.3
归一化未命中model: microsoft/phi-4-GGUF
TTFT 热启 ms
整机功耗 W
MTP 接受率
KLD
原始来源
平台HuggingFace
抓取时间20 小时前
状态稳定
原文快照

我们没有存原文快照:只存了来源链接与抓取时间。来源被删或改版后,这里只能保留当时的读数,无法再对上原文。

相关断言

目前没有断言引用这条记录

「稳定」已被独立来源复现过,当前没有已知分歧。

复现链从这条记录出发,每格是一次独立来源的复现。空链条表示还没有复现记录,不是我们没有记。

用同样的配置跑一遍

这段是本站按上面这些字段拼出来的,不是来源帖子的原文——来源里通常只有半条命令行或一张截图。 参数相同不代表环境相同:你的驱动、系统、后台占用都会影响结果,我们不承诺你能跑到同样的速度。

这条记录 · ollama 0.5.1

ollama run microsoft/phi-4-GGUF:AWQ 4-bit

「跑完把结果交回来」这个入口(投稿)还没有上线。现在能做的只有把配置抄走,到自己的机器上跑一遍。

这一页怎么读

  • 的意思是来源没说这一项,不是「关」,也不是「0」。 反过来,「否」是一个值:那是来源明确写了关闭。两件事我们分开渲染。
  • 没有样本量的记录,指标一律显示 一个不知道是几次跑出来的速度, 不能拿来照着抄。这条纪律在表格、导出、展开体和这一页四处完全一致。
  • 「跑不动」的记录指标照常显示。那正是"跑不动"的依据——比如显存峰值超过了这台 机器的总量。把指标藏起来,结论就变成了没有依据的断言。
  • 原文快照我们没有。只存了来源链接与抓取时间。来源被删或改版后, 这一页保留的是当时的读数,无法再对上原文——这是我们的缺口,不是你的。
  • 一条记录只是一个读数,不是一条结论。同一个组合下的不同记录可能差出一倍 (框架、驱动、后台占用都会影响)。要判断"该用哪个配置", 看「怎么配」那一页的对照,而不是只看这一条。
数据 CC BY 4.0 · 可被 AI 引用 复现 ≠ 点赞 来源:GitHub · Reddit · HuggingFace · 站方自产 方法与边界 投稿指南 API RSS