llama.cpp 手动部署
下载 GGUF、自选量化与参数,理解每一步在做什么——可控性与性能天花板都更高。
llama.cpp 手动部署
拿到 llama.cpp
从 GitHub Releases 下载对应平台的预编译包,里面含 llama-server、llama-bench 等全套工具;需要特定 GPU 后端或最新特性时,也可以按官方文档源码编译。
# https://github.com/ggml-org/llama.cpp/releases下载 GGUF 模型,选量化档位
Hugging Face 搜「模型名 + GGUF」即可找到社区转换好的权重。档位怎么选:Q4_K_M 是通用均衡档(8B 约 4.7 GB),Q8_0 更接近原模型精度但体积接近翻倍;模型页通常附各档位体积与困惑度对照表。
起服务
llama-server 启动一个带网页对话界面的本地服务:-ngl 把多少层放进 GPU(99 = 全部;显存不够就调小,如 24),-c 是上下文长度。浏览器打开 localhost:8080 即可对话。
llama-server -m Qwen3-8B-Q4_K_M.gguf -ngl 99 -c 8192
# 对话界面:http://localhost:8080最影响速度的两个参数
GPU 卸载层数(-ngl)决定算力落在哪:放不下显存的层会退回 CPU,速度断崖式下降。上下文长度(-c)决定 KV cache 占用:显存随长度线性上涨,拉太长会挤掉模型本身的驻留空间。从短上下文起步,逐步加到自己机器的边界。
上下文对吞吐的挤压,公开实测常常不标注——本站「当前局限」里把它列为第一位,测自己的机器时值得单独验证这一项。
测出你机器的数字
llama-bench 输出两组吞吐:pp 是提示词处理速度(对应本站的 Prefill),tg 是文本生成速度(对应本站的 Decode)。换量化档、改 -ngl、拉长 -c 各跑一遍,就能摸清自己机器的能力边界。
llama-bench -m Qwen3-8B-Q4_K_M.gguf -ngl 99把结果投给本站
记下模型、硬件、框架版本、量化档位和 pp/tg 两组数字,通过「联系方式」页投给我们——带原始出处的实测经过人工核对后进入数据库,让下一个搜「4090 跑 32B」的人少走弯路。