ML
模力Lab
· 开源大模型本地部署
首页
方案库
知识库
方案生成器
MCP 接入
关于
首页
方案库
知识库
方案生成器
搜索
方案库
共 54 个方案,按你的需求筛选 · 勾选最多 3 个可对比
类型
全部
LLM
LLM + Embedding
LLM (Reasoning)
LLM + Embedding + Reranker
难度
入门
进阶
专家
排序
成本
性能
显存从小到大
对比
MiniCPM-2B
2B · LLM
入门
GPU
1× RTX 3060 12GB
显存
12 GB
推理引擎
Ollama
性能
50 tok/s
预估成本
¥0.25
万
详情 →
对比
Qwen3-4B-Instruct-2507
4B · LLM
入门
GPU
1× RTX 3060
显存
12 GB
推理引擎
Ollama
性能
55 tok/s
预估成本
¥0.25
万
详情 →
对比
Qwen3-4B-Instruct-2507
4B · LLM
入门
GPU
1× RTX 4060 8GB / RTX 3060 12GB
显存
6 GB
推理引擎
Ollama / llama.cpp
性能
45 tok/s
预估成本
¥0.50
万
详情 →
对比
Qwen3-8B
8B · LLM
入门
GPU
1× NVIDIA RTX 4060/3060 12GB
显存
12 GB
推理引擎
Ollama / llama.cpp / LM Studio
性能
35 tok/s
预估成本
¥0.50
万
详情 →
对比
Llama 4 Scout 17B
17B · LLM
入门
GPU
1× RTX 4060 Ti 16GB / RTX 4070 Ti 12GB
显存
10 GB
推理引擎
llama.cpp / Ollama
性能
30 tok/s
预估成本
¥0.55
万
详情 →
对比
Qwen2.5-7B
7B · LLM
入门
GPU
1× RTX 4060 Ti 16GB
显存
16 GB
推理引擎
Ollama
性能
35 tok/s
预估成本
¥0.55
万
详情 →
对比
Qwen3-8B
8B · LLM
入门
GPU
1× RTX 4060 Ti 16GB / RTX 3080
显存
12 GB
推理引擎
Ollama / llama.cpp
性能
55 tok/s
预估成本
¥0.55
万
详情 →
对比
GLM-4-9B
9B · LLM
入门
GPU
1× RTX 4060 Ti 16GB
显存
16 GB
推理引擎
Ollama
性能
38 tok/s
预估成本
¥0.55
万
详情 →
对比
Qwen2.5-7B + BGE-M3
7B + 568M · LLM + Embedding
入门
GPU
1× RTX 4060 Ti 16GB
显存
16 GB
推理引擎
Ollama + Xinference
性能
30 tok/s
预估成本
¥0.60
万
详情 →
对比
Qwen3-4B-Instruct-2507
4B · LLM
入门
GPU
1× RTX 4060/3060
显存
6 GB
推理引擎
Ollama/llama.cpp
性能
45 tok/s
预估成本
¥0.65
万
详情 →
对比
Llama-3.1-8B
8B · LLM
入门
GPU
1× RTX 3090
显存
24 GB
推理引擎
Ollama
性能
40 tok/s
预估成本
¥0.70
万
详情 →
对比
Qwen3-14B
14B · LLM
入门
GPU
1× RTX 4060 Ti 16GB / RTX 3090 24GB
显存
8 GB
推理引擎
Ollama / llama.cpp
性能
35 tok/s
预估成本
¥0.70
万
详情 →
对比
Qwen3-30B-A3B
30B (MoE, 3B active) · LLM
入门
GPU
1× NVIDIA RTX 4070/3080 10-12GB
显存
18 GB
推理引擎
Ollama / llama.cpp
性能
45 tok/s
预估成本
¥0.70
万
详情 →
对比
Mistral 3 14B
14B · LLM
入门
GPU
1× RTX 4060 Ti 16GB / RTX 3090 24GB
显存
8 GB
推理引擎
Ollama / vLLM / llama.cpp
性能
35 tok/s
预估成本
¥0.70
万
详情 →
对比
Qwen3-30B-A3B-Instruct-2507 + Ollama v0.32.4
30B (MoE, 3B active) · LLM
入门
GPU
1× RTX 4090 / RTX 3090
显存
24 GB
推理引擎
Ollama v0.32.4
性能
40 tok/s
预估成本
¥1.20
万
详情 →
对比
Qwen3-30B-A3B
30B (MoE, 3B激活) · LLM
入门
GPU
1× RTX 4090 24GB / RTX 3090 24GB
显存
18 GB
推理引擎
Ollama / vLLM / llama.cpp
性能
55 tok/s
预估成本
¥1.50
万
详情 →
对比
Qwen3-30B-A3B-Instruct-2507
30B-A3B MoE · LLM
进阶
GPU
1× RTX 4090 24GB
显存
20 GB
推理引擎
Ollama vLLM llama.cpp
性能
35 tok/s
预估成本
¥1.50
万
详情 →
对比
Qwen3-30B-A3B
30B/3B active · LLM
入门
GPU
1× RTX 4090 24GB
显存
18 GB
推理引擎
Ollama/llama.cpp
性能
45 tok/s
预估成本
¥1.50
万
详情 →
对比
Qwen3-30B-A3B-Instruct-2507
30B-A3B · LLM
进阶
GPU
1× RTX 4090/3090
显存
24 GB
推理引擎
Ollama/llama.cpp/vLLM
性能
25 tok/s
预估成本
¥1.50
万
详情 →
对比
Qwen3-30B-A3B-Instruct-2507
30B-A3B · LLM
入门
GPU
1× RTX 4090
显存
24 GB
推理引擎
Ollama
性能
45 tok/s
预估成本
¥1.50
万
详情 →
对比
Qwen3-30B-A3B
30B (MoE, 3B激活) · LLM
入门
GPU
1× RTX 4090 24GB / RTX 3090
显存
18 GB
推理引擎
Ollama / llama.cpp
性能
45 tok/s
预估成本
¥1.50
万
详情 →
对比
Qwen3-30B-A3B
30B (MoE, 3B active) · LLM
入门
GPU
1× RTX 4090
显存
24 GB
推理引擎
Ollama
性能
55 tok/s
预估成本
¥1.50
万
详情 →
对比
Qwen3-8B
8B · LLM
入门
GPU
1× RTX 4090
显存
24 GB
推理引擎
Ollama
性能
55 tok/s
预估成本
¥1.50
万
详情 →
对比
Qwen3-30B-A3B-Instruct-2507
30B · LLM
进阶
GPU
1× RTX 4090
显存
24 GB
推理引擎
Ollama
性能
40 tok/s
预估成本
¥1.50
万
详情 →
对比
Qwen3-14B (Dense)
14B · LLM
入门
GPU
1× RTX 4090 24GB / RTX 4080 16GB
显存
12 GB
推理引擎
Ollama / llama.cpp / vLLM
性能
30 tok/s
预估成本
¥1.60
万
详情 →
对比
Qwen3-14B
14B · LLM
入门
GPU
1× RTX 4070 Ti / RTX 3080
显存
16 GB
推理引擎
Ollama / llama.cpp
性能
30 tok/s
预估成本
¥1.60
万
详情 →
对比
Qwen3-14B
14B · LLM
进阶
GPU
1× RTX 4090 24GB / A5000
显存
22 GB
推理引擎
Ollama / vLLM
性能
35 tok/s
预估成本
¥1.60
万
详情 →
对比
Qwen3-14B
14B · LLM
入门
GPU
1× RTX 4080/4090
显存
16 GB
推理引擎
Ollama
性能
28 tok/s
预估成本
¥1.60
万
详情 →
对比
Qwen3-14B
14B · LLM
入门
GPU
1× RTX 4090 24GB
显存
24 GB
推理引擎
Ollama/llama.cpp
性能
35 tok/s
预估成本
¥1.60
万
详情 →
对比
Qwen2.5-7B (Fine-tuned)
7B · LLM
进阶
GPU
1× RTX 4090
显存
24 GB
推理引擎
LLaMA-Factory
性能
35 tok/s
预估成本
¥1.80
万
详情 →
对比
Qwen2.5-14B
14B · LLM
入门
GPU
1× RTX 4090
显存
24 GB
推理引擎
vLLM
性能
28 tok/s
预估成本
¥1.80
万
详情 →
对比
Llama 4 Scout 17B
17B · LLM
进阶
GPU
1× RTX 4090/3090
显存
16 GB
推理引擎
Ollama/llama.cpp
性能
30 tok/s
预估成本
¥1.80
万
详情 →
对比
Qwen3-32B
32B · LLM
入门
GPU
1× RTX 4090 24GB
显存
24 GB
推理引擎
Ollama
性能
18 tok/s
预估成本
¥2.20
万
详情 →
对比
Qwen3-32B
32B · LLM
入门
GPU
1× RTX 4090 / A6000
显存
24 GB
推理引擎
llama.cpp / Ollama
性能
20 tok/s
预估成本
¥2.20
万
详情 →
对比
Llama 4 Scout
109B/17B active · LLM
进阶
GPU
2× 2x RTX 4090 24GB
显存
48 GB
推理引擎
llama.cpp/Ollama
性能
30 tok/s
预估成本
¥3.60
万
详情 →
对比
DeepSeek-R1-Distill-32B
32B · LLM (Reasoning)
进阶
GPU
2× RTX 4090
显存
48 GB
推理引擎
vLLM
性能
18 tok/s
预估成本
¥4.00
万
详情 →
对比
Qwen2.5-Coder-32B
32B · LLM
进阶
GPU
2× RTX 4090
显存
48 GB
推理引擎
vLLM
性能
32 tok/s
预估成本
¥4.20
万
详情 →
对比
Qwen2.5-72B
72B · LLM
进阶
GPU
4× RTX 4090
显存
96 GB
推理引擎
vLLM
性能
45 tok/s
预估成本
¥8.50
万
详情 →
对比
Llama-3.1-70B
70B · LLM
进阶
GPU
2× A100 80GB
显存
160 GB
推理引擎
vLLM
性能
55 tok/s
预估成本
¥22.00
万
详情 →
对比
Qwen2.5-72B 高并发版
72B · LLM
专家
GPU
4× A100 40GB
显存
160 GB
推理引擎
TensorRT-LLM
性能
120 tok/s
预估成本
¥35.00
万
详情 →
对比
Qwen3-235B-A22B-Thinking-2507
235B (MoE, 22B激活) · LLM
专家
GPU
4× 4×A100 80GB / 8×RTX 4090
显存
240 GB
推理引擎
vLLM / SGLang
性能
18 tok/s
预估成本
¥42.00
万
详情 →
对比
Qwen3-235B-A22B-Instruct-2507
235B/22B active · LLM
专家
GPU
4× 4x A100 80GB
显存
280 GB
推理引擎
vLLM/SGLang
性能
25 tok/s
预估成本
¥42.00
万
详情 →
对比
Qwen2.5-72B + BGE-M3 + Reranker
72B + 568M + 500M · LLM + Embedding + Reranker
专家
GPU
4× A100 80GB
显存
320 GB
推理引擎
vLLM + Xinference
性能
80 tok/s
预估成本
¥42.00
万
详情 →
对比
Qwen3-235B-A22B-Instruct-2507
235B-A22B (MoE) · LLM
专家
GPU
4× A100 80GB / H100 80GB
显存
280 GB
推理引擎
vLLM / SGLang
性能
20 tok/s
预估成本
¥42.00
万
详情 →
对比
Qwen3-235B-A22B-Instruct-2507
235B MoE 22B active · LLM
专家
GPU
4× A100 80GB
显存
320 GB
推理引擎
vLLM
性能
25 tok/s
预估成本
¥42.00
万
详情 →
对比
GLM-5.2
745B MoE 44B active · LLM
专家
GPU
2× A100 80GB / H100
显存
160 GB
推理引擎
vLLM / SGLang
性能
15 tok/s
预估成本
¥45.00
万
详情 →
对比
Qwen3-235B-A22B-Instruct-2507
235B-A22B · LLM
专家
GPU
2× A100 80G/H100
显存
160 GB
推理引擎
vLLM/SGLang
性能
15 tok/s
预估成本
¥45.00
万
详情 →
对比
DeepSeek V3 671B-A37B
671B-A37B · LLM
专家
GPU
4× A100 80G/H100
显存
320 GB
推理引擎
vLLM/SGLang
性能
10 tok/s
预估成本
¥50.00
万
详情 →
对比
Qwen3-235B-A22B-Instruct-2507
235B (MoE, 22B激活) · LLM
专家
GPU
4× A100 80GB x4 / H100 x2
显存
240 GB
推理引擎
vLLM / SGLang
性能
20 tok/s
预估成本
¥50.00
万
详情 →
对比
Llama 4 Maverick
400B/17B active · LLM
专家
GPU
4× 4x A100 80GB
显存
280 GB
推理引擎
vLLM/TensorRT-LLM
性能
20 tok/s
预估成本
¥50.00
万
详情 →
对比
DeepSeek-V4
~200B (预估) · LLM
专家
GPU
4× 4×A100 80GB / 8×RTX 4090
显存
280 GB
推理引擎
vLLM / SGLang
性能
15 tok/s
预估成本
¥50.00
万
详情 →
对比
DeepSeek-V3-671B
671B (MoE) · LLM
专家
GPU
8× A100 80GB
显存
640 GB
推理引擎
TensorRT-LLM
性能
60 tok/s
预估成本
¥85.00
万
详情 →
对比
GLM-5.2
745B-A44B (MoE) · LLM
专家
GPU
8× H100 80GB / A100 80GB
显存
600 GB
推理引擎
vLLM / 智谱推理框架
性能
15 tok/s
预估成本
¥95.00
万
详情 →
对比
Qwen3.5-397B-A17B
397B/17B激活 · LLM
专家
GPU
8× 8×A100 80GB
显存
240 GB
推理引擎
vLLM
性能
20 tok/s
预估成本
¥95.00
万
详情 →