知识库

模型选型、部署实战、性能调优、FAQ 一站搞定 · 共 11

全部RAG选型FAQ微调性能部署
部署#vLLM#模型部署#Kimi K3

vLLM v0.27.0 深度解读:Kimi K3 全面支持、Qwen3.5 上线与 FlashAttention 4 集成

vLLM v0.27.0 带来 561 个提交,全面支持 Kimi K3 和 Qwen3.5 模型,集成 FlashAttention 4 并升级 PyTorch 2.13。本文详解新特性、硬件配置建议与成本估算。

小龙女·2026/8/11·11 阅读
FAQ#FAQ#Ollama#CUDA

常见问题 FAQ:Ollama 安装 / CUDA 错误 / 显存不够

跑开源大模型总会遇到各种坑。本文汇总 10 个最常见问题及解决方案。

盖茨·2026/7/22·22 阅读
微调#微调#QLoRA#LLaMA-Factory

Fine-tuning 微调入门:QLoRA + LLaMA-Factory 零代码

微调是让通用模型变专才的关键。本文用 QLoRA 在 1×4090 上微调 Qwen2.5-7B。

盖茨·2026/7/22·15 阅读
性能#性能#QPS#显存

性能调优:推理速度、显存、并发 3 维度

QPS 不够?显存爆了?本文从推理引擎、量化、batching 三个角度系统讲调优。

盖茨·2026/7/22·19 阅读
选型#成本#TCO#私有部署

成本优化:私有部署 vs API 调用的 TCO 对比

同样用 Qwen2.5-72B,私有部署和 API 调用哪个划算?本文算给你看。

盖茨·2026/7/22·23 阅读
性能#量化#INT8#INT4

量化技术:FP16 / INT8 / INT4 / QLoRA 怎么选?

量化能让大模型在消费级 GPU 跑起来,但选错了效果会崩。本文讲清 FP16/INT8/INT4/QLoRA 区别。

盖茨·2026/7/22·25 阅读
RAG#RAG#BGE-M3#Qwen2.5

RAG 知识库完整方案:Qwen2.5 + BGE + vLLM

RAG = 检索增强生成。本文给出企业级 RAG 完整方案:Qwen2.5-7B + BGE-M3 + vLLM 部署。

盖茨·2026/7/22·18 阅读
部署#vLLM#高并发#72B

vLLM 高并发部署实战:Qwen2.5-72B 50 QPS 调优

生产环境要支撑高并发?vLLM 是首选。本文讲 PagedAttention、连续批处理、量化部署。

盖茨·2026/7/22·19 阅读
部署#Ollama#Qwen2.5#快速入门

Ollama 一键部署入门:5 分钟跑通 Qwen2.5-7B

Ollama 是最简单的开源大模型部署工具,本文带你在 Linux/Windows/Mac 上 5 分钟跑起来。

盖茨·2026/7/22·28 阅读
选型#GPU#4090#A100

GPU 选型指南:4090/3090/A100/H100 怎么选

开源大模型部署,GPU 怎么选?本文从显存、算力、功耗、价格 4 个维度帮你对比。

盖茨·2026/7/22·25 阅读
选型#模型选型#7B#14B

怎么选适合自己的开源大模型规模?7B/14B/72B/671B 怎么挑

从 7B 到 671B,开源大模型怎么选?本文按使用场景、预算、硬件条件帮你理清思路。

盖茨·2026/7/22·26 阅读