← 返回知识库
部署#vLLM#高并发#72B#PagedAttention

vLLM 高并发部署实战:Qwen2.5-72B 50 QPS 调优

生产环境要支撑高并发?vLLM 是首选。本文讲 PagedAttention、连续批处理、量化部署。

盖茨·2026/7/22·19 阅读

vLLM 高并发部署实战:Qwen2.5-72B 50 QPS 调优

为什么选 vLLM?

vLLM = 业界最强开源 LLM 推理引擎之一:

  • PagedAttention:显存利用率提升 4-24 倍
  • 连续批处理:吞吐提升 10-20 倍
  • OpenAI 兼容 API:无缝替换
  • 量化支持:GPTQ/AWQ/INT8/INT4

快速部署

# 安装
pip install vllm

# 启动(以 Qwen2.5-72B 为例,需要 2×A100 80G)
python -m vllm.entrypoints.openai.api_server \\
  --model Qwen/Qwen2.5-72B-Instruct \\
  --tensor-parallel-size 2 \\
  --gpu-memory-utilization 0.9 \\
  --max-model-len 4096 \\
  --port 8000

性能调优

关键参数

参数 说明 推荐值
--tensor-parallel-size 张量并行 GPU 数 等于 GPU 数
--max-num-seqs 批处理最大序列数 256
--max-model-len 最大上下文长度 4096-8192
--gpu-memory-utilization GPU 显存使用率 0.85-0.95
--dtype 数据类型 bfloat16
--quantization 量化方法 awq/gptq

性能数据(Qwen2.5-72B, 2×A100 80G)

并发 吞吐量 (tok/s) 平均延迟 P99 延迟
1 45 220ms 280ms
8 280 600ms 1.2s
32 580 2.5s 4.8s
64 620 5.2s 9.5s

监控

# Prometheus metrics
curl http://localhost:8000/metrics

推荐监控:

  • vllm:gpu_cache_usage
  • vllm:num_requests_running
  • vllm:num_requests_waiting
  • vllm:time_to_first_token_seconds

踩坑

  • OOM--gpu-memory-utilization < 0.9 显存利用率 → 调低
  • 冷启动慢:第一次推理要 5-15s 加载,可用 --enforce-eager 跳过编译
  • 量化后效果差:AWQ 比 GPTQ 损失小,优先 AWQ

相关推荐