← 教程

Ollama 一键跑模型

从安装到第一次对话的最快路径:一条命令把开源模型跑在自己机器上。

Ollama 一键跑模型

安装 Ollama

macOS 与 Windows 直接从 ollama.com/download 下载安装包;Linux 一条命令完成安装。装完后在终端确认版本号,能打印即安装成功。

curl -fsSL https://ollama.com/install.sh | sh
ollama -v

跑第一个模型

一条命令:首次运行会自动下载模型权重(8B 级别约 5 GB,视网速几分钟),完成后直接进入对话,输入 /bye 退出。

这条命令背后发生了三件事:按量化档位下载 GGUF 权重、把模型加载进显存或内存、在本机启动推理服务——之后所有操作都围绕这套本地服务。

ollama run qwen3:8b

对照显存,选对规模

显存不够时 Ollama 会把放不下的层挪进内存,能跑但明显变慢。Q4 量化、短上下文下的量级参考:4B 约 3 GB、8B 约 6 GB、14B 约 10 GB、32B 约 20 GB 显存。

实际数字随上下文长度、并发与版本组合波动不小——这正是本站按记录标注实测环境、而不是只给一个均值的原因。

显存不够或没有独显

先换更小的规模:4B 级别在集成显卡与纯 CPU 上也能跑。纯 CPU 生成速度大致降到独显的十几分之一,作答慢但完整可用,适合先体验再决定升级硬件。

ollama run qwen3:4b

当本地 API 用

Ollama 常驻后提供 OpenAI 兼容接口,把客户端或 IDE 插件的 base URL 指向本地地址即可接入。随时查看当前加载的模型与显存占用。

ollama serve
# OpenAI 兼容接口:http://localhost:11434/v1
ollama ps

下一步

想要更多控制——自定义上下文长度、挑量化档位、给机器测出基准数字——看第二篇《llama.cpp 手动部署》;跑出来的数字也欢迎通过「联系方式」投给本站,充实实测数据库。