← 返回方案库
Qwen3-235B-A22B-Thinking-2507
235B (MoE, 22B激活)·LLM·专家
预估硬件成本
¥42.00
Qwen3-235B-A22B-Thinking-2507 部署装机示意图235B (MoE, 22B激活)专家
部署装机4× 4×A100 80GB / 8×RTX 4090·240 GB 总显存
vLLM / SGLang · FP8 / INT4(GGUF)

硬件配置

GPU 型号
4× 4×A100 80GB / 8×RTX 4090
总显存
240 GB
内存
256 GB
存储
470 GB
量化方式
FP8 / INT4(GGUF)
推理引擎
vLLM / SGLang

性能与场景

生成速度
18 tokens/s
适用场景
深度推理/数学/代码/科研
部署难度
专家
数据来源
🟡 估算
测试环境
4x 4×A100 80GB / 8×RTX 4090 240GB 总显存 · vLLM / SGLang FP8 / INT4(GGUF)
Qwen3旗舰推理模型(2507版),MoE架构235B总参/22B激活,FP8需240GB显存(4×A100),INT4量化可降至~130GB。数学推理与代码生成能力达开源顶级水平,支持思考/非思考双模式。

想部署这套方案?

留下您的联系方式,模力Lab 团队 24 小时内回复,提供从硬件选型到部署落地的全流程支持。