← 教程

llama.cpp 手动部署

下载 GGUF、自选量化与参数,理解每一步在做什么——可控性与性能天花板都更高。

llama.cpp 手动部署

拿到 llama.cpp

从 GitHub Releases 下载对应平台的预编译包,里面含 llama-server、llama-bench 等全套工具;需要特定 GPU 后端或最新特性时,也可以按官方文档源码编译。

# https://github.com/ggml-org/llama.cpp/releases

下载 GGUF 模型,选量化档位

Hugging Face 搜「模型名 + GGUF」即可找到社区转换好的权重。档位怎么选:Q4_K_M 是通用均衡档(8B 约 4.7 GB),Q8_0 更接近原模型精度但体积接近翻倍;模型页通常附各档位体积与困惑度对照表。

起服务

llama-server 启动一个带网页对话界面的本地服务:-ngl 把多少层放进 GPU(99 = 全部;显存不够就调小,如 24),-c 是上下文长度。浏览器打开 localhost:8080 即可对话。

llama-server -m Qwen3-8B-Q4_K_M.gguf -ngl 99 -c 8192
# 对话界面:http://localhost:8080

最影响速度的两个参数

GPU 卸载层数(-ngl)决定算力落在哪:放不下显存的层会退回 CPU,速度断崖式下降。上下文长度(-c)决定 KV cache 占用:显存随长度线性上涨,拉太长会挤掉模型本身的驻留空间。从短上下文起步,逐步加到自己机器的边界。

上下文对吞吐的挤压,公开实测常常不标注——本站「当前局限」里把它列为第一位,测自己的机器时值得单独验证这一项。

测出你机器的数字

llama-bench 输出两组吞吐:pp 是提示词处理速度(对应本站的 Prefill),tg 是文本生成速度(对应本站的 Decode)。换量化档、改 -ngl、拉长 -c 各跑一遍,就能摸清自己机器的能力边界。

llama-bench -m Qwen3-8B-Q4_K_M.gguf -ngl 99

把结果投给本站

记下模型、硬件、框架版本、量化档位和 pp/tg 两组数字,通过「联系方式」页投给我们——带原始出处的实测经过人工核对后进入数据库,让下一个搜「4090 跑 32B」的人少走弯路。