Qwen3-235B-A22B-Thinking-2507
235B (MoE, 22B激活)·LLM·专家
预估硬件成本
¥42.00万
235B (MoE, 22B激活)专家部署装机4× 4×A100 80GB / 8×RTX 4090·240 GB 总显存
vLLM / SGLang · FP8 / INT4(GGUF)
硬件配置
- GPU 型号
- 4× 4×A100 80GB / 8×RTX 4090
- 总显存
- 240 GB
- 内存
- 256 GB
- 存储
- 470 GB
- 量化方式
- FP8 / INT4(GGUF)
- 推理引擎
- vLLM / SGLang
性能与场景
- 生成速度
- 18 tokens/s
- 适用场景
- 深度推理/数学/代码/科研
- 部署难度
- 专家
- 数据来源
- 🟡 估算
- 测试环境
- 4x 4×A100 80GB / 8×RTX 4090 240GB 总显存 · vLLM / SGLang FP8 / INT4(GGUF)
Qwen3旗舰推理模型(2507版),MoE架构235B总参/22B激活,FP8需240GB显存(4×A100),INT4量化可降至~130GB。数学推理与代码生成能力达开源顶级水平,支持思考/非思考双模式。