Qwen2.5-72B 高并发版
72B·LLM·专家
预估硬件成本
¥35.00万
72B专家部署装机4× A100 40GB·160 GB 总显存
TensorRT-LLM · INT8
硬件配置
- GPU 型号
- 4× A100 40GB
- 总显存
- 160 GB
- 内存
- 256 GB
- 存储
- 500 GB
- 量化方式
- INT8
- 推理引擎
- TensorRT-LLM
性能与场景
- 生成速度
- 120 tokens/s
- 适用场景
- 高并发 API 服务
- 部署难度
- 专家
- 数据来源
- 🟡 估算
- 测试环境
- 4x A100 40GB 160GB 总显存 · TensorRT-LLM INT8
4 卡 A100 + INT8 量化 + TensorRT-LLM,高并发场景最优方案。支持 100+ 并发请求,适合对外提供 API 服务。