← 返回方案库
Qwen2.5-72B 高并发版
72B·LLM·专家
预估硬件成本
¥35.00
Qwen2.5-72B 高并发版 部署装机示意图72B专家
部署装机4× A100 40GB·160 GB 总显存
TensorRT-LLM · INT8

硬件配置

GPU 型号
4× A100 40GB
总显存
160 GB
内存
256 GB
存储
500 GB
量化方式
INT8
推理引擎
TensorRT-LLM

性能与场景

生成速度
120 tokens/s
适用场景
高并发 API 服务
部署难度
专家
数据来源
🟡 估算
测试环境
4x A100 40GB 160GB 总显存 · TensorRT-LLM INT8
4 卡 A100 + INT8 量化 + TensorRT-LLM,高并发场景最优方案。支持 100+ 并发请求,适合对外提供 API 服务。

想部署这套方案?

留下您的联系方式,模力Lab 团队 24 小时内回复,提供从硬件选型到部署落地的全流程支持。