← 返回方案库
Qwen3-30B-A3B-Instruct-2507
30B-A3B·LLM·入门
预估硬件成本
¥1.50
Qwen3-30B-A3B-Instruct-2507 部署装机示意图30B-A3B入门
部署装机1× RTX 4090·24 GB 总显存
Ollama · INT4

硬件配置

GPU 型号
1× RTX 4090
总显存
24 GB
内存
32 GB
存储
100 GB
量化方式
INT4
推理引擎
Ollama

性能与场景

生成速度
45 tokens/s
适用场景
边缘服务器/工作站部署Qwen3最新MoE模型,激活仅3B参数,推理速度快
部署难度
入门
数据来源
🟢 实测参考
测试环境
RTX 4090 24GB · Ollama INT4
Qwen3-30B-A3B是MoE架构,总参数30B但每次推理仅激活3B参数。配合Ollama v0.32.4(修复了Qwen3 MoE解码问题),在单张RTX 4090上即可流畅运行。INT4量化后显存占用约18GB,适合边缘服务器和工作站场景。

想部署这套方案?

留下您的联系方式,模力Lab 团队 24 小时内回复,提供从硬件选型到部署落地的全流程支持。