Llama-3.1-8B-Instruct · Apple M3 Max(MacBook Pro 14)
Ollama · Q4_K_M · 由 2 条实测记录聚合(2 个来源类型)
实测指标
- Decode
- 39.15tok/s
- Prefill
- 408.85tok/s
- TTFT
- 0.505s
- 显存占用
- 5.8GB
- TTFB *
- —
- MTP 接受率
- —
- 功耗
- 47.3W
数字是「Ollama · Q4_K_M」这个组合下 全部已上架记录的均值。
TTFB 的单位尚待确认(原型标注为 GB,按录入原值展示)。
运行事实
- 实测显存占用
- 5.8 GB
- Apple M3 Max(MacBook Pro 14) 标称显存
- 36 GB
本站只收录实测数据。能不能在你的机器上跑起来,请对照你的显存、量化大小与上下文长度自行判断—— 我们没有你的硬件信息。
基本配置
这些字段逐条记录各不相同,因此只在全部记录取值相同时才在这里给出值。
- 框架版本
- 各条不同2 条中有 2 种取值看各条明细
- 操作系统
- macOS 15.32/2 一致
- 驱动版本
- 未填2/2 一致
- CUDA 版本
- 未填2/2 一致
- 上下文长度
- 81922/2 一致
- 批大小
- 未填2/2 一致
- GPU 层数
- 未填2/2 一致
- Flash Attention
- 未填2/2 一致
硬件与模型
- 硬件
- Apple M3 Max(MacBook Pro 14)笔记本
- 标称显存
- 36 GB
- 模型
- Llama-3.1-8B-Instruct
- 参数规模
- 8 B
比的是「同一个模型 + 同一款硬件」下的不同框架与量化。点上面的按钮切换指标。
该模型 + 硬件下目前只有这一种配置,暂无横向对比。
- Ollama · Q4_K_M 当前408.85 tok/s
实测明细(2 条)
这一行的均值由下列记录算出。每一行是一次独立的实测,带各自的配置、证据等级与来源。
| # | 框架版本 | 操作系统 | 驱动 / CUDA | 上下文 | 批大小 | GPU 层 | Flash Attn | Decode | Prefill | 显存 | TTFT | TTFB | MTP | 功耗 | 证据等级 | 来源 | 最后验证 | 更新时间 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | 0.5.7 | macOS 15.3 | 未填 / 未填 | 8192 | 未填 | 未填 | 未填 | 38.9 | 402.1 | 5.8 | 0.52 | — | — | — | L0 自报 | 2026-07-21 | 2026-09-18 | |
| 2 | 0.5.9 | macOS 15.3 | 未填 / 未填 | 8192 | 未填 | 未填 | 未填 | 39.4 | 415.6 | 5.8 | 0.49 | — | — | 47.3 | L1 已复现 | Hugging Face | 2026-08-18 | 2026-09-18 |
表格可横向滚动查看更多列。
来源原文
#1 Reddit · https://www.reddit.com/r/LocalLLaMA/comments/araoai_m3max_8b
M3 Max 统一内存下 8B Q4 约 39 tok/s,功耗约 45W。
#2 Hugging Face · https://huggingface.co/datasets/araoai/benchmarks/discussions/1
Ollama 0.5.9 复现 39.4 tok/s。