部署#Ollama#Qwen2.5#快速入门
Ollama 一键部署入门:5 分钟跑通 Qwen2.5-7B
Ollama 是最简单的开源大模型部署工具,本文带你在 Linux/Windows/Mac 上 5 分钟跑起来。
盖茨·2026/7/22·28 阅读
Ollama 一键部署入门:5 分钟跑通 Qwen2.5-7B
什么是 Ollama?
Ollama = 模型管理 + 推理引擎 + REST API,一键搞定:
- 自动下载模型
- 自动管理显存
- 提供 OpenAI 兼容 API
- 支持 GPU 加速
安装
# Linux
curl -fsSL https://ollama.com/install.sh | sh
# Mac
brew install ollama
# Windows:下载 ollama.com/download
跑 Qwen2.5-7B
# 启动服务
ollama serve
# 拉模型(首次会自动下载 ~4GB)
ollama pull qwen2.5:7b
# 命令行对话
ollama run qwen2.5:7b "你好,介绍下你自己"
REST API 调用
Ollama 默认监听 11434 端口,提供 OpenAI 兼容 API:
curl http://localhost:11434/v1/chat/completions \\
-H "Content-Type: application/json" \\
-d '{
"model": "qwen2.5:7b",
"messages": [{"role":"user","content":"你好"}]
}'
常用命令
ollama list # 列出已下载的模型
ollama ps # 列出运行中的模型
ollama rm qwen2.5:7b # 删除模型
ollama cp qwen2.5:7b my-model # 复制模型
性能调优
- GPU 加速:自动检测 NVIDIA GPU
- 量化:默认是 Q4_K_M(4-bit),显存省一半
- 并发:设置
OLLAMA_NUM_PARALLEL=4允许 4 个并发请求 - 长上下文:设置
OLLAMA_CONTEXT_LENGTH=8192调整上下文
常见问题
- 显存不够:用更小的模型(
qwen2.5:3b)或更狠的量化(qwen2.5:7b-q4_0) - 下载慢:用
OLLAMA_MIRROR=https://your-mirror.com ollama pull ...换镜像 - 启动慢:第一次推理要加载模型到显存,约 5-10 秒