简介:这套 Ollama 安装资源包,面向需要在 Linux/macOS 等类 Unix 环境中部署 Ollama 的研发与运维人员,覆盖从获取安装包、执行安装脚本、完成基础配置到服务验证的完整流程。压缩包整体只有 13KB,包含 3 个文件:PHP 脚本负责获取安装包,shell 脚本自动检查环境、安装依赖并设置权限,txt 说明文档则汇总系统要求、安装步骤、常见报错与处理建议。已有 434 人学习下载,特别适合初次接触 Ollama 或希望高效复现部署流程的中初级用户。资料虽精简,但内容并不单薄,既解释如何自定义安装脚本以适应不同目录或依赖环境,也提醒安装前后的注意事项,并给出服务启动是否成功的验证方法;遇到依赖缺失、权限不足或网络连接等问题时,还能依据文档快速定位原因。对没有图形界面的服务器或需要批量部署的场景来说,这份材料能有效降低试错成本,是完成 Ollama 安装和基础调优的实用参考。 先说结论:Ollama 就是目前把大模型拉到本地跑最简单的那条路。装好它,你不需要写一行 Python 调用代码,不需要懂 CUDA 和显存分配,只需要一个命令就能把 Llama、Qwen、DeepSeek 这些开源模型跑起来,然后通过一个本地端口去调用它,或者接上 Open WebUI、Cherry Studio、VS Code 这类前端工具。这篇文章面向的是想把 Ollama 装好、装明白的人,不管你是第一次接触本地大模型的小白,还是已经在 Docker 里折腾过 AI 服务的开发者,装好之后的模型管理、目录迁移、国内网络加速、API 对接这几个点,应该都能帮你少踩几个坑。
1. 安装前先搞清楚:Ollama 到底是装什么
很多人第一次接触“安装 Ollama”这个动作时,会把它理解成跟装微信、装 Photoshop 一样的事——双击安装包,下一步下一步,完事。这个理解没错,但很容易忽略一个关键点:Ollama 本身只是一个运行引擎,就像你装了一个播放器,但播放器里还没有任何视频。Ollama 安装完成后,你还需要单独执行ollama run qwen2.5这类命令去拉取模型文件,才能真正用起来。
这个“引擎 + 模型”分离的架构,好处是模型可以随便换,随时删,磁盘不够了就换个小模型,跟引擎互不影响。坏处是,如果你只装好了 Ollama 而不去拉模型,打开它你会发现界面空空如也,甚至有点怀疑自己是不是装错了。
1.1 底层逻辑:安装包里藏着什么
以 Windows 安装包为例,OllamaSetup.exe这个文件实际做的事可以拆成三步:
- 把 Ollama 主程序解压到
%LocalAppData%\Programs\Ollama,同时注册为 Windows 服务(所以安装完你会在任务管理器里看到ollama.exe和ollama app.exe两个进程,一个是后台服务,一个是托盘界面)。 - 在系统环境变量里写入 Ollama 的路径,方便你在终端里直接敲
ollama命令。 - 启动后台服务,默认监听
127.0.0.1:11434这个地址。
macOS 版本逻辑类似,安装的是.zip或.pkg包,程序放在/Applications/Ollama.app,模型文件默认放在~/.ollama/models。Linux 版本则是一个二进制文件加一个 systemd 服务脚本,模型目录默认在/usr/share/ollama/.ollama/models。
理解了这个底层结构,后面遇到问题就好排查了。比如你发现ollama命令找不到,十有八九是环境变量没生效;比如你想把模型装到 D 盘,本质就是改OLLAMA_MODELS这个环境变量的指向。
1.2 平台支持范围:哪些设备能装
在动手之前,先确认你的设备在支持列表里,不然装到一半才发现跑不了,白费功夫。
| 平台 | 支持情况 | 关键条件 |
|---|---|---|
| Windows | 支持 | Windows 10 22H2 及以上,需要 64 位系统 |
| macOS | 支持 | macOS 13 (Ventura) 及以上,Apple Silicon (M 系列) 体验最佳 |
| Linux | 支持 | 主流发行版均可,需要 x86_64 或 ARM64 架构 |
| Windows 7 | 不支持 | Ollama 官方从未支持 Win7,装不上是正常的 |
| 低配电脑 | 可装但体验差 | CPU 模式能跑,但速度慢、显存小就别选大模型 |
有个很容易被忽略的点:macOS 上如果你还是 Intel 芯片的老机器,Ollama 也能装,但推理速度和新款 M 系列芯片差距非常明显。Windows 上如果你有 N 卡,Ollama 会自动调用 CUDA 走 GPU 加速;如果是 A 卡,部分场景也能跑,但兼容性不如 N 卡;纯 CPU 的机器也能跑,只是速度要放低预期。
2. Windows 安装实操:从下载到跑通第一个模型
Windows 是大多数人的主战场,所以我先把这套流程讲透。整个流程分三步:下载安装、确认服务状态、跑通第一个模型。
2.1 下载加速:国内网络环境的处理方案
提到 Ollama 安装,网上吐槽最多的就是“下载太慢了”“官网打不开”。https://ollama.com/download这个页面确实在国内访问不稳定,GitHub 的 release 文件也经常断流。我试过几种方案,最靠谱的是这两个:
方案 A:使用国内镜像站下载安装包
国内有一些开源镜像站会同步 Ollama 的安装包,比如部分高校镜像站和云厂商的镜像仓库。你不需要改任何配置,只需要用镜像地址把安装包下载到本地,然后正常双击安装。
方案 B:手动下载 + 校验文件
如果你能找到直接的下载链接,可以用浏览器自带的下载工具或 IDM 这类多线程工具下载,比在官网网页上等要快得多。下载完成后,建议对照一下官方发布的 SHA256 校验值,验证文件完整性和安全性。
注意:任何从非官方渠道下载的安装包,安装前都建议右键查看数字签名,确认发布者是 "Ollama, Inc."。我见过不少第三方网站捆绑了广告软件,安装包里混了额外的东西,这个习惯养成没有坏处。
2.2 安装到 D 盘:两种方式对比
“Ollama 怎么安装到 D 盘”这个搜索词出现的频率非常高,因为默认装到 C 盘会占用大量空间,尤其后面拉模型动不动就是 4-7GB 一个文件。我试过两种方式,各有适用场景:
方式一:直接修改模型目录(推荐,最简单)
其实从一开始就不用纠结安装目录。Ollama 的主程序非常小(100MB 以内),真正占空间的是模型文件。你只需要在安装第一个模型之前,把模型存放目录指向 D 盘就行。
操作步骤:
- 按
Win键,搜索“环境变量”,打开“编辑系统环境变量”。 - 点击“环境变量”,在“系统变量”区域点击“新建”。
- 变量名填
OLLAMA_MODELS,变量值填你想存放模型的路径,比如D:\ollama\models。 - 确定保存后,重启终端窗口(环境变量才会生效),再执行
ollama run命令。
方式二:安装时直接改路径(进阶操作)
如果你希望主程序也装在 D 盘,可以通过命令行静默安装指定目录。打开 PowerShell(管理员模式),进入安装包所在目录,执行:
.\OllamaSetup.exe /DIR="D:\ollama"这个方式本质上是让安装程序把主程序文件解压到指定位置。需要说明的是,这个操作是我自己试过可行的方案,Ollama 官方文档里没有详细描述,不同版本的安装包可能行为略有差异,如果执行后还是默认路径,就退回方式一。
2.3 首次启动与验证
安装完成后,系统托盘区会出现一个羊驼图标。点击图标,打开应该是“Ollama is running”的状态。然后在终端里执行:
ollama --version能正常输出版本号,说明核心程序没问题。接着拉取第一个模型,我建议从小模型开始,比如:
ollama run qwen2.5:1.5b这个模型大约 1GB 左右,下载速度取决于网络环境,跑起来后随便输入一句话测试,能收到流畅回复就说明整套环境已经通了。
提示:测试阶段建议先用小模型验证链路,不要一上来就拉 70B 的大模型。我见过很多新手因为第一次就下载超大模型,等半天没下载完,然后以为安装失败了。
3. macOS 与 Linux 安装:各自的门道
macOS 和 Linux 的安装方式比 Windows 简单一些,但也有一些各自的坑,分开说。
3.1 macOS:拖拽安装,但有一个隐藏设置
macOS 的安装非常简单,从官网下载Ollama-darwin.zip,解压后把Ollama.app拖进“应用程序”文件夹,打开就完成了。首次打开时,系统会弹“是否确认打开”的提示,因为这是非 App Store 应用,需要在“系统设置 - 隐私与安全性”里点击“仍要打开”。
macOS 上有个比较实用的设置是配置模型存放位置。Apple Silicon 的 Mac 硬盘空间普遍宝贵,如果默认识别到的用户目录空间不够,可以用同样的环境变量方式把模型放到外置硬盘:
launchctl setenv OLLAMA_MODELS "/Volumes/ExternalDrive/ollama-models"设置完成需要退出 Ollama 并重新打开才生效。这个命令只对当前用户会话生效,重启后需要重新设置,如果你想持久化,就得写个 LaunchAgent 脚本,那属于进阶操作,这里不展开。
3.2 Linux:一条命令脚本和手动部署
Linux 安装 Ollama 非常简单,一行命令:
curl -fsSL https://ollama.com/install.sh | sh这个脚本会自动识别你的发行版和 GPU 环境,装好主程序、创建 systemd 服务、配置好开机自启。装完同样执行ollama --version验证。
但如果你的服务器访问官网脚本超时,或者你想离线部署到内网机器,就需要手动部署:
- 从 GitHub Releases 页面下载
ollama-linux-amd64.tgz(或对应架构的包)。 - 解压到指定目录:
tar -C /usr/local -xzf ollama-linux-amd64.tgz- 手动启动服务:
nohup ollama serve > /tmp/ollama.log 2>&1 &离线部署多用在企业内网环境,因为模型文件也需要内网分发,这种情况建议配合 ModelScope 或 HuggingFace 的离线下载工具一起用,模型文件放到OLLAMA_MODELS指向的目录即可。
3.3 WSL 2 的使用场景与内存配置
Windows 上很多开发者喜欢用 WSL 2(Windows Subsystem for Linux)而不是原生 Windows 版本跑 Ollama,原因是 Linux 环境下做开发联调更顺,模型推理的兼容性问题也少一些。
WSL 2 里安装 Ollama 和 Linux 安装方式一样,直接用官方脚本即可。但有一个管理上的坑必须提醒:WSL 2 使用的虚拟磁盘(ext4.vhdx)会自动膨胀,删除模型后磁盘空间不会自动回收。如果你频繁拉取和删除不同模型,Windows 的 C 盘空间会越来越小。解决方法是在 PowerShell 里执行:
wsl --shutdown diskpart # 选择 WSL 的 vhdx 文件 # 执行 compact vhdx如果觉得手动操作太麻烦,也可以把 WSL 的虚拟磁盘整体移动到其他分区,网上有现成工具,这里点到为止。
4. 模型下载加速:国内镜像源与手动导入
装好 Ollama 之后,最大的痛点就变成了模型下载。“ollama pull 太慢”“一直卡在 downloading”这类问题几乎每个新手都会遇到。Ollama 的模型文件托管在 GitHub Release 或 Docker Hub 这类平台,国内直连速度确实不理想,但这个有合法的解决方案,不需要任何旁门左道。
4.1 方案一:配置国内代理环境变量
如果你有可用的 HTTP 代理服务,比如自己搭的或者公司提供的,可以通过环境变量让 Ollama 走代理下载:
Windows 系统变量里添加:
HTTP_PROXY=http://你的代理地址:端口 HTTPS_PROXY=http://你的代理地址:端口然后重启 Ollama 服务。这个方案的优点是所有模型下载都能加速,缺点是你得先有一个可用的代理服务。
4.2 方案二:从 ModelScope 手动下载 GGUF 文件再导入
阿里旗下的 ModelScope(魔搭社区)上有大量模型的 GGUF 格式文件,国内下载速度很快。操作思路是:先用modelscope下载模型文件,再让 Ollama 识别这个文件。
具体步骤如下:
- 安装 modelscope 下载工具:
pip install modelscope- 下载某个模型的 GGUF 文件,以 Qwen2.5-7B-Instruct 为例:
modelscope download --model 'Qwen/Qwen2.5-7B-Instruct-GGUF' --local_dir './models' --include 'qwen2.5-7b-instruct-q4_k_m.gguf'- 编写 Modelfile 文件,指明模型位置:
FROM ./models/qwen2.5-7b-instruct-q4_k_m.gguf- 用
ollama create创建可用的模型:
ollama create qwen2.5-7b -f Modelfile- 验证:
ollama run qwen2.5-7b这套流程的核心价值在于绕开了 Ollama 官方仓库,直接从国内下载模型文件。模型文件内容完全一样,运行效果没有区别。我实际测试下来,q4_k_m 量化的 7B 模型文件大约 4.7GB,ModelScope 下载速度可以跑到 10MB/s 以上,比直连官方仓库稳定得多。
4.3 方案三:改 OLLAMA_HOST 做多机共享
还有一种进阶玩法:在一台下载速度快、配置好的机器上下载好模型,然后把OLLAMA_MODELS目录整个复制到另一台机器。只要版本一致,直接就能用,不需要重新下载。这个方法对多台电脑、内网部署的场景很实用。
5. 安装后的常用操作与 API 接入
Ollama 装好只是起点。真正实用的是把它暴露成一个本地 API 服务,接到各种应用里。这个过程比大多数人想象中简单得多。
安装完成后,Ollama 会自动在后台监听11434端口。直接访问http://localhost:11434,如果返回Ollama is running,说明服务在正常监听。
5.1 核心命令速查
| 命令 | 作用 | 使用频率 |
|---|---|---|
ollama list | 查看本地已下载的模型列表 | 极高 |
ollama run <模型名> | 进入交互式对话 | 极高 |
ollama pull <模型名> | 下载指定模型 | 高 |
ollama rm <模型名> | 删除指定模型 | 高 |
ollama ps | 查看当前加载在内存中的模型 | 中 |
ollama serve | 启动 API 服务(默认已自启) | 低 |
ollama stop <模型名> | 停止正在运行的模型 | 中 |
5.2 本地 API 调用示例
用 Python 调用是很多人的刚需场景。最简方式是用requests发一个 POST 请求,不需要任何官方的 SDK:
import requests import json response = requests.post( "http://localhost:11434/api/generate", json={ "model": "qwen2.5:7b", "prompt": "用一句话介绍你自己", "stream": False } ) result = response.json() print(result["response"])更进阶的玩法是接 OpenAI SDK,因为 Ollama 提供了兼容 OpenAI 的接口。你只需要改 base_url:
from openai import OpenAI client = OpenAI( base_url="http://localhost:11434/v1", api_key="ollama" # 随便填,Ollama 本地不校验 ) response = client.chat.completions.create( model="qwen2.5:7b", messages=[{"role": "user", "content": "写一段 Python 快排"}] ) print(response.choices[0].message.content)这个兼容接口非常实用,很多原本面向 OpenAI API 开发的应用,只需要切换 base_url 就能直接对接本地模型。比如 VS Code 里装 Claude Code 插件后,配置指向http://localhost:11434/v1,就能用本地模型辅助写代码。
5.3 推荐几个周边工具
装好 Ollama 之后,有几个工具我几乎每天都在用:
- Open WebUI:一个非常成熟的前端界面,安装后能在浏览器里像 ChatGPT 一样对话,支持多用户、知识库上传。
- Cherry Studio:Windows 上极好用的桌面客户端,自带模型管理界面,跟 Ollama 无缝对接。
- Continue:VS Code 插件,能在 IDE 里调用本地模型做代码补全和 Chat 问答。
这些工具的安装方式基本都是“软件本身 + 指向 Ollama 的接口地址”,没有太多技术门槛,按提示操作就行。
6. 常见问题排查:安装失败与运行异常实录
最后这部分是我最想写的。这些坑都是我实际踩过或者帮别人排查过的,整理成速查表,遇到问题先照着查一遍,能省下大量搜索时间。
6.1 常见错误速查表
| 问题现象 | 可能原因 | 解决方案 |
|---|---|---|
ollama命令无法识别 | 环境变量未生效 | 重启终端;在系统环境变量里确认路径存在 |
| 官网安装包下载极慢 | 网络访问不稳定 | 用国内镜像站或手动下载工具加速 |
| 提示“Windows 7 不支持” | 系统版本过低 | 升级系统;Ollama 明确要求 Win10 22H2+ |
| 模型下载卡在 0% 或中途失败 | 网络断流 | 配置代理环境变量;从 ModelScope 手动下载导入 |
| 启动后端口 11434 被占用 | 其他服务占用了端口 | 修改端口:环境变量OLLAMA_HOST=0.0.0.0:11435重新指定 |
| 模型回答速度极慢 | CPU 模式或小内存 | 确认 GPU 驱动版本;减少上下文窗口长度,如/set parameter num_ctx 2048 |
| 提示 OOM 显存不足 | 模型过大超出显存 | 换小模型;选用量化更低的版本,如 Q4 转 Q2 |
| 安装后被安全软件拦截 | 误报行为 | 去安全软件隔离区恢复文件;确认安装包来源可信 |
6.2 WSL 安装太慢的处理方法
搜索词里有一个“wsl --install 太慢”,这其实是个热门问题,而且常和 Ollama 组合出现。如果你打算在 WSL 里装 Ollama,wsl --install卡住是很常见的情况,原因通常是服务器连接速度不理想。
解决思路有几个,我推荐先试第一种:
- 挂代理跑
wsl --install,如果代理可用的话,下载速度会明显改善。 - 从微软官网手动下载 WSL 的安装包(
.msixbundle),然后用Add-AppxPackage命令安装,绕开命令行拉取流程。 - 如果只是不想让 WSL 虚拟磁盘占 C 盘,可以先把 WSL 装好后,用
wsl --export和wsl --import把它迁移到 D 盘。
6.3 API 调用连接失败的处理思路
如果你把 Ollama 接入 Cherry Studio 或 Claude Code 时发现“连不上”,不要慌,按这个顺序排查:
先确认 Ollama 服务在运行。在浏览器访问http://localhost:11434,如果页面显示Ollama is running,说明服务层面没问题。
再确认你填的地址对不对。很多工具要求填http://localhost:11434而不是http://127.0.0.1:11434,虽然本质上一样,但某些工具坑很多,只要有一个地方拼写不一致就连不上。
最后确认端口有没有被改过。如果你之前设置过OLLAMA_HOST环境变量改了端口,所有客户端请求都要跟着改。
6.4 我的一个小建议:先定好目录再开始
最后分享一个经验。装 Ollama 这个动作本身难度不大,但如果你一开始就规划好“模型文件放哪、数据目录放哪”,后面能省很多事。我一开始就是随手装在了默认目录,结果玩了几天模型之后,C 盘被塞了 20 多个 G,最后不得不手动迁移模型目录,重启服务,折腾了一上午。
所以我的建议是:不管是 Windows、macOS 还是 Linux,第一步先把OLLAMA_MODELS或~/.ollama指向一个空间充裕的分区,然后再开始拉模型。这个操作花不了两分钟,却能避免后面最大的那个坑。
另外再补一个实用经验:Ollama 下载大模型时如果中断,重新执行ollama pull会断点续传,不需要从头开始,所以看到下载卡住时别急着删了重来,先等一等或者重启服务试试。
本地模型这块现在发展很快,Ollama 本身也在不停迭代。你不需要一次性搞懂所有功能,先把安装、模型下载、接口调用这三件事跑通,就已经超过大多数人了。后面再慢慢研究多模型切换、Docker 部署、嵌入到自己的应用里,都是水到渠成的事。
本文还有配套的精品资源,点击获取