知识库

模型选型、部署实战、性能调优、FAQ 一站搞定 · 共 3

全部RAG选型微调性能FAQ部署
部署#vLLM#模型部署#Kimi K3

vLLM v0.27.0 深度解读:Kimi K3 全面支持、Qwen3.5 上线与 FlashAttention 4 集成

vLLM v0.27.0 带来 561 个提交,全面支持 Kimi K3 和 Qwen3.5 模型,集成 FlashAttention 4 并升级 PyTorch 2.13。本文详解新特性、硬件配置建议与成本估算。

小龙女·2026/8/11·11 阅读
部署#vLLM#高并发#72B

vLLM 高并发部署实战:Qwen2.5-72B 50 QPS 调优

生产环境要支撑高并发?vLLM 是首选。本文讲 PagedAttention、连续批处理、量化部署。

盖茨·2026/7/22·20 阅读
部署#Ollama#Qwen2.5#快速入门

Ollama 一键部署入门:5 分钟跑通 Qwen2.5-7B

Ollama 是最简单的开源大模型部署工具,本文带你在 Linux/Windows/Mac 上 5 分钟跑起来。

盖茨·2026/7/22·29 阅读