ML
模力Lab
· 开源大模型本地部署
首页
方案库
知识库
方案生成器
MCP 接入
关于
首页
方案库
知识库
方案生成器
搜索
方案库
共 29 个方案,按你的需求筛选 · 勾选最多 3 个可对比
类型
全部
LLM
Embedding
LLM + Embedding
难度
入门
排序
成本
性能
显存从小到大
对比
Qwen3-4B-Instruct-2507
4B · LLM
入门
GPU
1× RTX 3060
显存
12 GB
推理引擎
Ollama
性能
55 tok/s
预估成本
¥0.25
万
详情 →
对比
MiniCPM-2B
2B · LLM
入门
GPU
1× RTX 3060 12GB
显存
12 GB
推理引擎
Ollama
性能
50 tok/s
预估成本
¥0.25
万
详情 →
对比
BGE-M3
568M · Embedding
入门
GPU
1× RTX 4060
显存
8 GB
推理引擎
Xinference
性能
5000 tok/s
预估成本
¥0.45
万
详情 →
对比
Qwen3-4B-Instruct-2507
4B · LLM
入门
GPU
1× RTX 4060 8GB / RTX 3060 12GB
显存
6 GB
推理引擎
Ollama / llama.cpp
性能
45 tok/s
预估成本
¥0.50
万
详情 →
对比
Qwen3-8B
8B · LLM
入门
GPU
1× NVIDIA RTX 4060/3060 12GB
显存
12 GB
推理引擎
Ollama / llama.cpp / LM Studio
性能
35 tok/s
预估成本
¥0.50
万
详情 →
对比
Qwen2.5-7B
7B · LLM
入门
GPU
1× RTX 4060 Ti 16GB
显存
16 GB
推理引擎
Ollama
性能
35 tok/s
预估成本
¥0.55
万
详情 →
对比
Qwen3-8B
8B · LLM
入门
GPU
1× RTX 4060 Ti 16GB / RTX 3080
显存
12 GB
推理引擎
Ollama / llama.cpp
性能
55 tok/s
预估成本
¥0.55
万
详情 →
对比
Llama 4 Scout 17B
17B · LLM
入门
GPU
1× RTX 4060 Ti 16GB / RTX 4070 Ti 12GB
显存
10 GB
推理引擎
llama.cpp / Ollama
性能
30 tok/s
预估成本
¥0.55
万
详情 →
对比
GLM-4-9B
9B · LLM
入门
GPU
1× RTX 4060 Ti 16GB
显存
16 GB
推理引擎
Ollama
性能
38 tok/s
预估成本
¥0.55
万
详情 →
对比
Qwen2.5-7B + BGE-M3
7B + 568M · LLM + Embedding
入门
GPU
1× RTX 4060 Ti 16GB
显存
16 GB
推理引擎
Ollama + Xinference
性能
30 tok/s
预估成本
¥0.60
万
详情 →
对比
Qwen3-4B-Instruct-2507
4B · LLM
入门
GPU
1× RTX 4060/3060
显存
6 GB
推理引擎
Ollama/llama.cpp
性能
45 tok/s
预估成本
¥0.65
万
详情 →
对比
Qwen3-30B-A3B
30B (MoE, 3B active) · LLM
入门
GPU
1× NVIDIA RTX 4070/3080 10-12GB
显存
18 GB
推理引擎
Ollama / llama.cpp
性能
45 tok/s
预估成本
¥0.70
万
详情 →
对比
Qwen3-14B
14B · LLM
入门
GPU
1× RTX 4060 Ti 16GB / RTX 3090 24GB
显存
8 GB
推理引擎
Ollama / llama.cpp
性能
35 tok/s
预估成本
¥0.70
万
详情 →
对比
Mistral 3 14B
14B · LLM
入门
GPU
1× RTX 4060 Ti 16GB / RTX 3090 24GB
显存
8 GB
推理引擎
Ollama / vLLM / llama.cpp
性能
35 tok/s
预估成本
¥0.70
万
详情 →
对比
Llama-3.1-8B
8B · LLM
入门
GPU
1× RTX 3090
显存
24 GB
推理引擎
Ollama
性能
40 tok/s
预估成本
¥0.70
万
详情 →
对比
Qwen3-30B-A3B-Instruct-2507 + Ollama v0.32.4
30B (MoE, 3B active) · LLM
入门
GPU
1× RTX 4090 / RTX 3090
显存
24 GB
推理引擎
Ollama v0.32.4
性能
40 tok/s
预估成本
¥1.20
万
详情 →
对比
Qwen3-30B-A3B
30B (MoE, 3B激活) · LLM
入门
GPU
1× RTX 4090 24GB / RTX 3090 24GB
显存
18 GB
推理引擎
Ollama / vLLM / llama.cpp
性能
55 tok/s
预估成本
¥1.50
万
详情 →
对比
Qwen3-30B-A3B
30B/3B active · LLM
入门
GPU
1× RTX 4090 24GB
显存
18 GB
推理引擎
Ollama/llama.cpp
性能
45 tok/s
预估成本
¥1.50
万
详情 →
对比
Qwen3-30B-A3B
30B (MoE, 3B active) · LLM
入门
GPU
1× RTX 4090
显存
24 GB
推理引擎
Ollama
性能
55 tok/s
预估成本
¥1.50
万
详情 →
对比
Qwen3-8B
8B · LLM
入门
GPU
1× RTX 4090
显存
24 GB
推理引擎
Ollama
性能
55 tok/s
预估成本
¥1.50
万
详情 →
对比
Qwen3-30B-A3B-Instruct-2507
30B-A3B · LLM
入门
GPU
1× RTX 4090
显存
24 GB
推理引擎
Ollama
性能
45 tok/s
预估成本
¥1.50
万
详情 →
对比
Qwen3-30B-A3B
30B (MoE, 3B激活) · LLM
入门
GPU
1× RTX 4090 24GB / RTX 3090
显存
18 GB
推理引擎
Ollama / llama.cpp
性能
45 tok/s
预估成本
¥1.50
万
详情 →
对比
Qwen3-14B
14B · LLM
入门
GPU
1× RTX 4080/4090
显存
16 GB
推理引擎
Ollama
性能
28 tok/s
预估成本
¥1.60
万
详情 →
对比
Qwen3-14B
14B · LLM
入门
GPU
1× RTX 4070 Ti / RTX 3080
显存
16 GB
推理引擎
Ollama / llama.cpp
性能
30 tok/s
预估成本
¥1.60
万
详情 →
对比
Qwen3-14B (Dense)
14B · LLM
入门
GPU
1× RTX 4090 24GB / RTX 4080 16GB
显存
12 GB
推理引擎
Ollama / llama.cpp / vLLM
性能
30 tok/s
预估成本
¥1.60
万
详情 →
对比
Qwen3-14B
14B · LLM
入门
GPU
1× RTX 4090 24GB
显存
24 GB
推理引擎
Ollama/llama.cpp
性能
35 tok/s
预估成本
¥1.60
万
详情 →
对比
Qwen2.5-14B
14B · LLM
入门
GPU
1× RTX 4090
显存
24 GB
推理引擎
vLLM
性能
28 tok/s
预估成本
¥1.80
万
详情 →
对比
Qwen3-32B
32B · LLM
入门
GPU
1× RTX 4090 24GB
显存
24 GB
推理引擎
Ollama
性能
18 tok/s
预估成本
¥2.20
万
详情 →
对比
Qwen3-32B
32B · LLM
入门
GPU
1× RTX 4090 / A6000
显存
24 GB
推理引擎
llama.cpp / Ollama
性能
20 tok/s
预估成本
¥2.20
万
详情 →