Qwen2.5-7B + BGE-M3
7B + 568M·LLM + Embedding·入门
预估硬件成本
¥0.60万
7B + 568M入门部署装机1× RTX 4060 Ti 16GB·16 GB 总显存
Ollama + Xinference · INT8
硬件配置
- GPU 型号
- 1× RTX 4060 Ti 16GB
- 总显存
- 16 GB
- 内存
- 32 GB
- 存储
- 200 GB
- 量化方式
- INT8
- 推理引擎
- Ollama + Xinference
性能与场景
- 生成速度
- 30 tokens/s
- 适用场景
- 企业知识库完整方案
- 部署难度
- 入门
- 数据来源
- 🟢 实测参考
- 测试环境
- RTX 4060 Ti 16GB 16GB · Ollama + Xinference INT8
单卡 4060Ti 跑 LLM + 向量模型,完整 RAG 方案。含文档解析、向量化、检索、生成全链路,企业知识库最低门槛方案。