← 返回知识库
部署#Ollama#Qwen2.5#快速入门

Ollama 一键部署入门:5 分钟跑通 Qwen2.5-7B

Ollama 是最简单的开源大模型部署工具,本文带你在 Linux/Windows/Mac 上 5 分钟跑起来。

盖茨·2026/7/22·28 阅读

Ollama 一键部署入门:5 分钟跑通 Qwen2.5-7B

什么是 Ollama?

Ollama = 模型管理 + 推理引擎 + REST API,一键搞定:

  • 自动下载模型
  • 自动管理显存
  • 提供 OpenAI 兼容 API
  • 支持 GPU 加速

安装

# Linux
curl -fsSL https://ollama.com/install.sh | sh

# Mac
brew install ollama

# Windows:下载 ollama.com/download

跑 Qwen2.5-7B

# 启动服务
ollama serve

# 拉模型(首次会自动下载 ~4GB)
ollama pull qwen2.5:7b

# 命令行对话
ollama run qwen2.5:7b "你好,介绍下你自己"

REST API 调用

Ollama 默认监听 11434 端口,提供 OpenAI 兼容 API:

curl http://localhost:11434/v1/chat/completions \\
  -H "Content-Type: application/json" \\
  -d '{
    "model": "qwen2.5:7b",
    "messages": [{"role":"user","content":"你好"}]
  }'

常用命令

ollama list           # 列出已下载的模型
ollama ps             # 列出运行中的模型
ollama rm qwen2.5:7b  # 删除模型
ollama cp qwen2.5:7b my-model  # 复制模型

性能调优

  1. GPU 加速:自动检测 NVIDIA GPU
  2. 量化:默认是 Q4_K_M(4-bit),显存省一半
  3. 并发:设置 OLLAMA_NUM_PARALLEL=4 允许 4 个并发请求
  4. 长上下文:设置 OLLAMA_CONTEXT_LENGTH=8192 调整上下文

常见问题

  • 显存不够:用更小的模型(qwen2.5:3b)或更狠的量化(qwen2.5:7b-q4_0
  • 下载慢:用 OLLAMA_MIRROR=https://your-mirror.com ollama pull ... 换镜像
  • 启动慢:第一次推理要加载模型到显存,约 5-10 秒

相关推荐