← 返回方案库
Qwen3-30B-A3B-Instruct-2507 + Ollama v0.32.4
30B (MoE, 3B active)·LLM·入门
预估硬件成本
¥1.20
Qwen3-30B-A3B-Instruct-2507 + Ollama v0.32.4 部署装机示意图30B (MoE, 3B active)入门
部署装机1× RTX 4090 / RTX 3090·24 GB 总显存
Ollama v0.32.4 · Q4_K_M GGUF

硬件配置

GPU 型号
1× RTX 4090 / RTX 3090
总显存
24 GB
内存
32 GB
存储
20 GB
量化方式
Q4_K_M GGUF
推理引擎
Ollama v0.32.4

性能与场景

生成速度
40 tokens/s
适用场景
高性价比 MoE 部署 / 256K 长上下文 / Agent 工具调用
部署难度
入门
数据来源
🟢 实测参考
测试环境
RTX 4090 / RTX 3090 24GB · Ollama v0.32.4 Q4_K_M GGUF
Ollama v0.32.4(2026-07-27发布)完美支持 Qwen3-30B-A3B-Instruct-2507。MoE 架构仅激活 3B 参数,单卡 24GB 即可运行。新版修复了 Qwen3 MoE 不同量化专家的解码问题,gate/up 投影加速 4-9%(M5 Max)。支持 256K 上下文(可扩展至 1M),适合 Agent、工具调用、长文本场景。Apple Silicon 用户可通过 MLX 引擎获得 Laguna GPU 加速。

想部署这套方案?

留下您的联系方式,模力Lab 团队 24 小时内回复,提供从硬件选型到部署落地的全流程支持。