FAQ#FAQ#Ollama#CUDA#错误
常见问题 FAQ:Ollama 安装 / CUDA 错误 / 显存不够
跑开源大模型总会遇到各种坑。本文汇总 10 个最常见问题及解决方案。
盖茨·2026/7/22·22 阅读
常见问题 FAQ:Ollama 安装 / CUDA 错误 / 显存不够
1. Ollama 安装失败
Linux 报错 "permission denied"
# 解决:手动加 systemd
sudo systemctl daemon-reload
sudo systemctl enable ollama
Mac 启动后立即退出
检查 Docker 是不是占了 11434 端口:
lsof -i :11434
2. CUDA out of memory
症状
RuntimeError: CUDA out of memory. Tried to allocate 14.00 GiB
解决
- 换更小的模型:
qwen2.5:3b代替qwen2.5:7b - 用更狠的量化:
qwen2.5:7b-q4_0代替qwen2.5:7b - 检查其他程序占显存:
nvidia-smi
3. 模型下载慢/失败
用国内镜像
# 设置环境变量
export HF_ENDPOINT=https://hf-mirror.com
huggingface-cli download Qwen/Qwen2.5-7B-Instruct
Ollama 镜像
# 编辑 /etc/systemd/system/ollama.service
Environment="OLLAMA_MIRROR=https://your-mirror.com"
4. 推理慢
检查 GPU 是否被用
nvidia-smi # 看 GPU 利用率
如果 GPU 利用率 0%
- NVIDIA 驱动没装:
nvidia-smi报错 - CUDA 版本不对:
nvcc --version - Ollama 没用 GPU:检查
OLLAMA_NUM_GPU=1
5. 中文乱码
模型支持中文,但生成结果乱码:
- 检查 prompt:
用中文回答 - 用 Qwen2.5 而不是 Llama
- 编码问题:
export LANG=en_US.UTF-8
6. 4090 跑 14B OOM
RTX 4090 是 24GB,14B FP16 需要 28GB:
- 量化:
qwen2.5:14b-q4_0(12GB 显存) - 或上 2×4090 + tensor-parallel
7. vLLM 启动报 "PyTorch CUDA version mismatch"
# 重新装匹配 CUDA 的 PyTorch
pip install torch==2.4.0 --index-url https://download.pytorch.org/whl/cu121
8. RAG 检索不到文档
- 检查 embedding 模型是否一致(文档用 BGE,查询也要用 BGE)
- chunk size 太大/太小(500-1000 字合适)
- top-k 设太小(k=3-5)
- 用 hybrid search (BM25 + 向量)
9. 微调效果差
- 数据量太少(至少 500 条)
- 数据质量差(错别字、不相关)
- 学习率太大(LoRA 用 1e-4)
- epoch 太多(3 个就够)
- 没评估(用 MMLU 验证)
10. 生产部署 QPS 不够
- 换 vLLM(比 Ollama 快 5-10 倍)
- 启用 prefix caching
- 加 GPU(多卡并行)
- 用 INT8 量化
- 监控 GPU cache usage(< 90% 加卡)
还有问题?
- 模力Lab 知识库:mlab.sy-ai.cc/kb
- 咨询客服:mlab.sy-ai.cc/solutions
- GitHub Issue:github.com/aitomoney/atmapi-web