知识库
模型选型、部署实战、性能调优、FAQ 一站搞定 · 共 3 篇
部署#vLLM#模型部署#Kimi K3
vLLM v0.27.0 深度解读:Kimi K3 全面支持、Qwen3.5 上线与 FlashAttention 4 集成
vLLM v0.27.0 带来 561 个提交,全面支持 Kimi K3 和 Qwen3.5 模型,集成 FlashAttention 4 并升级 PyTorch 2.13。本文详解新特性、硬件配置建议与成本估算。
小龙女·2026/8/11·11 阅读
部署#vLLM#高并发#72B
vLLM 高并发部署实战:Qwen2.5-72B 50 QPS 调优
生产环境要支撑高并发?vLLM 是首选。本文讲 PagedAttention、连续批处理、量化部署。
盖茨·2026/7/22·20 阅读
部署#Ollama#Qwen2.5#快速入门
Ollama 一键部署入门:5 分钟跑通 Qwen2.5-7B
Ollama 是最简单的开源大模型部署工具,本文带你在 Linux/Windows/Mac 上 5 分钟跑起来。
盖茨·2026/7/22·29 阅读