← 返回方案库
Qwen3-30B-A3B
30B (MoE, 3B激活)·LLM·入门
预估硬件成本
¥1.50
Qwen3-30B-A3B 部署装机示意图30B (MoE, 3B激活)入门
部署装机1× RTX 4090 24GB / RTX 3090 24GB·18 GB 总显存
Ollama / vLLM / llama.cpp · INT4 (Q4_K_M GGUF)

硬件配置

GPU 型号
1× RTX 4090 24GB / RTX 3090 24GB
总显存
18 GB
内存
32 GB
存储
20 GB
量化方式
INT4 (Q4_K_M GGUF)
推理引擎
Ollama / vLLM / llama.cpp

性能与场景

生成速度
55 tokens/s
适用场景
高性价比MoE架构,30B参数仅3B激活,推理速度快
部署难度
入门
数据来源
🟢 实测参考
测试环境
RTX 4090 24GB / RTX 3090 24GB 18GB · Ollama / vLLM / llama.cpp INT4 (Q4_K_M GGUF)
通义千问3代MoE旗舰,总参数30B但每次推理仅激活3B,实现大模型智能+小模型速度。INT4量化后18GB显存可单卡4090运行,推理速度达55 tok/s。2507版本大幅增强数学/代码/推理能力。消费级显卡能跑的最大聪明模型。

想部署这套方案?

留下您的联系方式,模力Lab 团队 24 小时内回复,提供从硬件选型到部署落地的全流程支持。