Qwen3-30B-A3B-Instruct-2507 + Ollama v0.32.4
30B (MoE, 3B active)·LLM·入门
预估硬件成本
¥1.20万
30B (MoE, 3B active)入门部署装机1× RTX 4090 / RTX 3090·24 GB 总显存
Ollama v0.32.4 · Q4_K_M GGUF
硬件配置
- GPU 型号
- 1× RTX 4090 / RTX 3090
- 总显存
- 24 GB
- 内存
- 32 GB
- 存储
- 20 GB
- 量化方式
- Q4_K_M GGUF
- 推理引擎
- Ollama v0.32.4
性能与场景
- 生成速度
- 40 tokens/s
- 适用场景
- 高性价比 MoE 部署 / 256K 长上下文 / Agent 工具调用
- 部署难度
- 入门
- 数据来源
- 🟢 实测参考
- 测试环境
- RTX 4090 / RTX 3090 24GB · Ollama v0.32.4 Q4_K_M GGUF
Ollama v0.32.4(2026-07-27发布)完美支持 Qwen3-30B-A3B-Instruct-2507。MoE 架构仅激活 3B 参数,单卡 24GB 即可运行。新版修复了 Qwen3 MoE 不同量化专家的解码问题,gate/up 投影加速 4-9%(M5 Max)。支持 256K 上下文(可扩展至 1M),适合 Agent、工具调用、长文本场景。Apple Silicon 用户可通过 MLX 引擎获得 Laguna GPU 加速。