Arao AI本地 AI 部署实测数据库

Llama-3.1-8B-Instruct · Apple M3 Max(MacBook Pro 14)

Ollama · Q4_K_M · 由 2 条实测记录聚合(2 个来源类型)

实测指标

Decode
39.15tok/s
Prefill
408.85tok/s
TTFT
0.505s
显存占用
5.8GB
TTFB *
MTP 接受率
功耗
47.3W

数字是「Ollama · Q4_K_M」这个组合下 全部已上架记录的均值

TTFB 的单位尚待确认(原型标注为 GB,按录入原值展示)。

运行事实

实测显存占用
5.8 GB
Apple M3 Max(MacBook Pro 14) 标称显存
36 GB

本站只收录实测数据。能不能在你的机器上跑起来,请对照你的显存、量化大小与上下文长度自行判断—— 我们没有你的硬件信息。

基本配置

这些字段逐条记录各不相同,因此只在全部记录取值相同时才在这里给出值。

框架版本
各条不同2 条中有 2 种取值看各条明细
操作系统
macOS 15.32/2 一致
驱动版本
未填2/2 一致
CUDA 版本
未填2/2 一致
上下文长度
81922/2 一致
批大小
未填2/2 一致
GPU 层数
未填2/2 一致
Flash Attention
未填2/2 一致

硬件与模型

硬件
Apple M3 Max(MacBook Pro 14)笔记本
标称显存
36 GB
模型
Llama-3.1-8B-Instruct
参数规模
8 B

横向对比

比的是「同一个模型 + 同一款硬件」下的不同框架与量化。点上面的按钮切换指标。

该模型 + 硬件下目前只有这一种配置,暂无横向对比。

  1. Ollama · Q4_K_M 当前408.85 tok/s

实测明细(2 条)

这一行的均值由下列记录算出。每一行是一次独立的实测,带各自的配置、证据等级与来源。

#框架版本操作系统驱动 / CUDA上下文批大小GPU 层Flash AttnDecodePrefill显存TTFTTTFBMTP功耗证据等级来源最后验证更新时间
10.5.7macOS 15.3未填 / 未填8192未填未填未填38.9402.15.80.52L0 自报Reddit2026-07-212026-09-18
20.5.9macOS 15.3未填 / 未填8192未填未填未填39.4415.65.80.4947.3L1 已复现Hugging Face2026-08-182026-09-18

表格可横向滚动查看更多列。

来源原文