Qwen3-30B-A3B-Instruct-2507
30B-A3B·LLM·进阶
预估硬件成本
¥1.50万
30B-A3B进阶部署装机1× RTX 4090/3090·24 GB 总显存
Ollama/llama.cpp/vLLM · GGUF Q4_K_M
硬件配置
- GPU 型号
- 1× RTX 4090/3090
- 总显存
- 24 GB
- 内存
- 32 GB
- 存储
- 20 GB
- 量化方式
- GGUF Q4_K_M
- 推理引擎
- Ollama/llama.cpp/vLLM
性能与场景
- 生成速度
- 25 tokens/s
- 适用场景
- 高质量对话、复杂推理、代码生成
- 部署难度
- 进阶
- 数据来源
- 🟢 实测参考
- 测试环境
- RTX 4090/3090 24GB · Ollama/llama.cpp/vLLM GGUF Q4_K_M
Qwen3 MoE架构,30B总参数但仅3B激活,性能接近大模型但显存占用低。2507版本支持256K上下文,单卡4090即可运行,性价比极高。