一、为什么需要本地部署大模型?
先给结论:本地部署大模型,核心就三个理由——隐私、免费、离线。
- 隐私:企业数据和你的代码、文档,不该上传到云端被别人训练。本地部署,数据不出门。
- 免费:API 按 token 计费,长期调用成本不低。本地跑,电费就是全部成本。
- 离线:内网环境、无网环境、出差路上,本地模型随时可用,不依赖网络。
目前主流的本地推理方案有三个:Ollama、vLLM、llama.cpp。它们各有侧重,没有绝对的好坏,只有适不适合你的场景。下面直接进入正题。
二、三个方案一句话简介
| 方案 | 一句话介绍 | 适用场景 |
|---|---|---|
| Ollama | 一条命令安装、一条命令跑模型的极简推理工具 | 新手入门、个人电脑、快速体验 |
| vLLM | 高吞吐、高并发的工业级推理引擎,支持 PagedAttention | 服务器部署、多用户并发、生产环境 |
| llama.cpp | 纯 C/C++ 实现,CPU 也能跑,极致轻量 | 低配电脑、嵌入式设备、无 GPU 环境 |
三、核心对比表格
| 对比维度 | Ollama | vLLM | llama.cpp |
|---|---|---|---|
| 安装难度 | ⭐ 极简,一条命令 | ⭐⭐⭐ 需 Python 环境 + pip | ⭐⭐ 需编译,但有预编译包 |
| 支持模型 | 丰富,Ollama 模型库一键拉取 | 主流开源模型(HF 格式) | GGUF 格式模型 |
| GPU 支持 | ✅ 自动调用 CUDA | ✅ 优秀,支持多卡并行 | ✅ 支持,但配置稍繁琐 |
| CPU 推理 | ✅ 支持(速度一般) | ❌ 基本不支持 | ✅ 极佳,专为 CPU 优化 |
| 内存占用 | 中等 | 较高(需预留 KV Cache) | 极低,可跑小内存设备 |
| API 接口 | OpenAI 兼容 API | OpenAI 兼容 API + 高性能批处理 | 自带 server,OpenAI 兼容 |
| 适用场景 | 个人开发、学习、快速原型 | 生产环境、高并发服务 | 边缘设备、低配机器 |
| 适合人群 | 初中级开发者、大学生 | 后端工程师、运维 | 嵌入式开发者、极客 |
四、安装步骤对比
1. Ollama(最简单)
# macOS / Linuxcurl-fsSLhttps://ollama.com/install.sh|sh# Windows 直接下载安装包:https://ollama.com/download# 验证安装ollama--version2. vLLM(需 Python 3.8+)
# 创建虚拟环境(推荐)python-mvenv vllm_env&&sourcevllm_env/bin/activate# 安装 vLLM(CUDA 12.1+)pipinstallvllm# 验证安装python-c"import vllm; print(vllm.__version__)"3. llama.cpp(编译安装)
# 克隆仓库gitclone https://github.com/ggerganov/llama.cpp&&cdllama.cpp# 编译(CPU 版)make# 如需 GPU 加速(以 CUDA 为例)makeLLAMA_CUDA=1五、DeepSeek 模型在三个方案上的运行方法
以DeepSeek-R1为例,三个方案各给最简运行代码。
1. Ollama 运行 DeepSeek-R1
# 一键拉取并运行(自动下载模型)ollama run deepseek-r1:7b# 或指定更大参数版本ollama run deepseek-r1:14b2. vLLM 运行 DeepSeek-R1
# 启动 OpenAI 兼容服务(需先下载 HF 模型)python-m vllm.entrypoints.openai.api_server \--model deepseek-ai/DeepSeek-R1-Distill-Qwen-7B \--port8000# 调用测试curl http://localhost:8000/v1/chat/completions \-H"Content-Type: application/json"\-d'{"model": "deepseek-ai/DeepSeek-R1-Distill-Qwen-7B", "messages": [{"role": "user", "content": "你好"}]}'3. llama.cpp 运行 DeepSeek-R1
# 先下载 GGUF 格式模型(如 DeepSeek-R1-Distill-Qwen-7B-GGUF)# 然后直接运行./llama-cli-mdeepseek-r1-7b.Q4_K_M.gguf\-p"你好,请介绍一下你自己"\-n512六、不同场景推荐
| 场景 | 推荐方案 | 推荐理由 |
|---|---|---|
| 新手入门 / 学生毕设 | ✅Ollama | 零配置、一条命令跑通,把精力放在业务上而不是环境上 |
| 服务器部署 / 高并发 | ✅vLLM | PagedAttention 显存利用率高,吞吐量是普通方案的数倍 |
| 低配电脑 / 嵌入式 | ✅llama.cpp | CPU 也能流畅推理,内存占用极低,适合树莓派等设备 |
一句话总结:个人玩选 Ollama,生产上线选 vLLM,硬件受限选 llama.cpp。
七、性能对比(官方 Benchmark 参考)
以下为三个方案在相同硬件上的推理速度参考数据(来源:各项目官方 GitHub Benchmark,非本人实测):
| 指标 | Ollama | vLLM | llama.cpp |
|---|---|---|---|
| 吞吐量(tokens/s) | ~800 | ~3200 | ~600 |
| 显存占用 | 中等 | 较高(预留 KV Cache) | 低 |
| 并发能力 | 低(单请求为主) | 极高(支持连续批处理) | 低 |
| 首 token 延迟 | 低 | 低 | 中 |
注意:llama.cpp 的优势在 CPU 推理,GPU 场景下吞吐量不如 vLLM,但胜在轻量灵活。
八、配套资源包下载
为了帮你少踩坑,我整理了一份《DeepSeek 本地部署完整教程资源包》,包含:
- 📦6 个可直接运行的 Python 脚本(Ollama / vLLM / llama.cpp 三种方案的调用示例)
- 📖图文安装指南(Windows / macOS / Linux 全覆盖)
- ❓常见问题汇总(显存不足、模型下载失败、API 调用报错等)
资源包已上传CSDN 文库,点击下方链接即可下载:
本文标签:大模型本地部署、Ollama、vLLM、llama.cpp、DeepSeek
如果这篇文章对你有帮助,欢迎点赞、收藏、关注,后续会持续更新大模型本地部署的实战教程!