部署#vLLM#高并发#72B#PagedAttention
vLLM 高并发部署实战:Qwen2.5-72B 50 QPS 调优
生产环境要支撑高并发?vLLM 是首选。本文讲 PagedAttention、连续批处理、量化部署。
盖茨·2026/7/22·19 阅读
vLLM 高并发部署实战:Qwen2.5-72B 50 QPS 调优
为什么选 vLLM?
vLLM = 业界最强开源 LLM 推理引擎之一:
- PagedAttention:显存利用率提升 4-24 倍
- 连续批处理:吞吐提升 10-20 倍
- OpenAI 兼容 API:无缝替换
- 量化支持:GPTQ/AWQ/INT8/INT4
快速部署
# 安装
pip install vllm
# 启动(以 Qwen2.5-72B 为例,需要 2×A100 80G)
python -m vllm.entrypoints.openai.api_server \\
--model Qwen/Qwen2.5-72B-Instruct \\
--tensor-parallel-size 2 \\
--gpu-memory-utilization 0.9 \\
--max-model-len 4096 \\
--port 8000
性能调优
关键参数
| 参数 | 说明 | 推荐值 |
|---|---|---|
--tensor-parallel-size |
张量并行 GPU 数 | 等于 GPU 数 |
--max-num-seqs |
批处理最大序列数 | 256 |
--max-model-len |
最大上下文长度 | 4096-8192 |
--gpu-memory-utilization |
GPU 显存使用率 | 0.85-0.95 |
--dtype |
数据类型 | bfloat16 |
--quantization |
量化方法 | awq/gptq |
性能数据(Qwen2.5-72B, 2×A100 80G)
| 并发 | 吞吐量 (tok/s) | 平均延迟 | P99 延迟 |
|---|---|---|---|
| 1 | 45 | 220ms | 280ms |
| 8 | 280 | 600ms | 1.2s |
| 32 | 580 | 2.5s | 4.8s |
| 64 | 620 | 5.2s | 9.5s |
监控
# Prometheus metrics
curl http://localhost:8000/metrics
推荐监控:
- vllm:gpu_cache_usage
- vllm:num_requests_running
- vllm:num_requests_waiting
- vllm:time_to_first_token_seconds
踩坑
- ❌ OOM:
--gpu-memory-utilization< 0.9 显存利用率 → 调低 - ❌ 冷启动慢:第一次推理要 5-15s 加载,可用
--enforce-eager跳过编译 - ❌ 量化后效果差:AWQ 比 GPTQ 损失小,优先 AWQ