← 返回知识库
FAQ#FAQ#Ollama#CUDA#错误

常见问题 FAQ:Ollama 安装 / CUDA 错误 / 显存不够

跑开源大模型总会遇到各种坑。本文汇总 10 个最常见问题及解决方案。

盖茨·2026/7/22·22 阅读

常见问题 FAQ:Ollama 安装 / CUDA 错误 / 显存不够

1. Ollama 安装失败

Linux 报错 "permission denied"

# 解决:手动加 systemd
sudo systemctl daemon-reload
sudo systemctl enable ollama

Mac 启动后立即退出

检查 Docker 是不是占了 11434 端口:

lsof -i :11434

2. CUDA out of memory

症状

RuntimeError: CUDA out of memory. Tried to allocate 14.00 GiB

解决

  • 换更小的模型:qwen2.5:3b 代替 qwen2.5:7b
  • 用更狠的量化:qwen2.5:7b-q4_0 代替 qwen2.5:7b
  • 检查其他程序占显存:nvidia-smi

3. 模型下载慢/失败

用国内镜像

# 设置环境变量
export HF_ENDPOINT=https://hf-mirror.com
huggingface-cli download Qwen/Qwen2.5-7B-Instruct

Ollama 镜像

# 编辑 /etc/systemd/system/ollama.service
Environment="OLLAMA_MIRROR=https://your-mirror.com"

4. 推理慢

检查 GPU 是否被用

nvidia-smi  # 看 GPU 利用率

如果 GPU 利用率 0%

  • NVIDIA 驱动没装:nvidia-smi 报错
  • CUDA 版本不对:nvcc --version
  • Ollama 没用 GPU:检查 OLLAMA_NUM_GPU=1

5. 中文乱码

模型支持中文,但生成结果乱码

  • 检查 prompt:用中文回答
  • 用 Qwen2.5 而不是 Llama
  • 编码问题:export LANG=en_US.UTF-8

6. 4090 跑 14B OOM

RTX 4090 是 24GB,14B FP16 需要 28GB:

  • 量化:qwen2.5:14b-q4_0 (12GB 显存)
  • 或上 2×4090 + tensor-parallel

7. vLLM 启动报 "PyTorch CUDA version mismatch"

# 重新装匹配 CUDA 的 PyTorch
pip install torch==2.4.0 --index-url https://download.pytorch.org/whl/cu121

8. RAG 检索不到文档

  • 检查 embedding 模型是否一致(文档用 BGE,查询也要用 BGE)
  • chunk size 太大/太小(500-1000 字合适)
  • top-k 设太小(k=3-5)
  • 用 hybrid search (BM25 + 向量)

9. 微调效果差

  • 数据量太少(至少 500 条)
  • 数据质量差(错别字、不相关)
  • 学习率太大(LoRA 用 1e-4)
  • epoch 太多(3 个就够)
  • 没评估(用 MMLU 验证)

10. 生产部署 QPS 不够

  • 换 vLLM(比 Ollama 快 5-10 倍)
  • 启用 prefix caching
  • 加 GPU(多卡并行)
  • 用 INT8 量化
  • 监控 GPU cache usage(< 90% 加卡)

还有问题?

  • 模力Lab 知识库:mlab.sy-ai.cc/kb
  • 咨询客服:mlab.sy-ai.cc/solutions
  • GitHub Issue:github.com/aitomoney/atmapi-web