与Ollama相关的文章可见Ollama :大模型本地部署与轻量化优化-CSDN博客
操作步骤
适用场景:本地编码模型部署,接入 opencode、Trea中 使用
一、前置准备
Python 虚拟环境(可选):
D:\venv_all
可创建一个虚拟环境py 3.12 -m venv venv_all
然后pip install torch transformers sentencepiece protobuf gguf官方下载地址:Ollama
国内镜像地址: Ollama - Ollama 框架模型下载目录:
D:\models\qwen2.5-coder-14b-gguf(地址自行选择)工具说明:本次走"下载官方现成 GGUF"路径,无需llama.cpp 的 convert/quantize 步骤
三、完整操作步骤
步骤 1:激活虚拟环境
在powershell中激活虚拟环境
D:\venv_all\Scripts\Activate.ps1
成功标志:提示符前出现
(venv_all)若报"禁止运行脚本",先执行
Set-ExecutionPolicy -Scope Process Bypass再激活
步骤 2:安装下载工具 (非必选项)
谨慎执行该命令,该命令会让huggingface_hub更新为最新版本,可能会与环境中的其它库包造成版本冲突
python -m pip install -U huggingface_hub
注:新版
huggingface-cli命令已废弃,一律使用hf命令
步骤 3:设置国内镜像加速
$env:HF_ENDPOINT = "https://hf-mirror.com"
步骤 4:查看仓库文件列表(确认档位)
hf download Qwen/Qwen2.5-Coder-14B-Instruct-GGUF --dry-run
官方仓库文件列表确认结果(2026-09-24): 不同量化精度的模型
| 文件 | 大小 |
|---|---|
| qwen2.5-coder-14b-instruct-q3_k_m.gguf | 7.3 G |
| qwen2.5-coder-14b-instruct-q4_k_m-00001-of-00002.gguf | 8.0 G + 987.7M |
| qwen2.5-coder-14b-instruct-q4_0.gguf | 8.5 G |
| qwen2.5-coder-14b-instruct-fp16.gguf | 29.5 G |
| 其余 Q2_K / Q5_K_M / Q6_K / Q8_0 | 5.8~15.7 G |
步骤 5:下载 Q3_K_M(约 7.3 GB)
结合自己电脑的配置(内层、显卡大小)选择合适的
hf download Qwen/Qwen2.5-Coder-14B-Instruct-GGUF --include "*q3_k_m*" --local-dir D:\models\qwen2.5-coder-14b-gguf
--include用小写*q3_k_m*(文件名小写),只匹配目标文件下载完成标准:
D:\models\qwen2.5-coder-14b-gguf\qwen2.5-coder-14b-instruct-q3_k_m.gguf存在且约 7.3 GB断网重跑同一条命令自动续传
步骤 6:写 Modelfile
在D:\models\qwen2.5-coder-14b-gguf新建Modelfile-coder14b(记事本,编码选 UTF-8):
FROM D:\models\qwen2.5-coder-14b-gguf\qwen2.5-coder-14b-instruct-q3_k_m.gguf PARAMETER temperature 0.7 PARAMETER top_p 0.9 PARAMETER num_ctx 8192
步骤 7:导入 Ollama
ollama create qwen2.5-coder-14b -f D:\models\qwen2.5-coder-14b-gguf\Modelfile-coder14b
成功标志:输出
success会自动将 GGUF 复制进
.ollama\models\blobs(D 盘再占约 7.3 GB)
步骤 8:验证
ollama list ollama run qwen2.5-coder-14b "用Python写一个快速排序,只给代码" ollama ps
验收标准:ollama ps该模型的SIZE 约 7.3 GB。
步骤 9:接入 opencode
编辑opencode.jsonc,在 ollama provider 的 models 里添加:
{ "name": "qwen2.5-coder-14b", "baseURL": "http://localhost:11434/v1" }baseURL 必须带
/v1,apiKey 随意占位(Ollama 不校验)
在trae中接入模型
1. 打开添加模型对话框
设置 → 模型 → 添加模型,选择自定义模型
2. 填写连接参数(OpenAI 兼容三件套)
| 字段 | 填写值 | 说明 |
|---|---|---|
| API 地址 / Base URL | http://localhost:11434/v1 | Ollama 的 OpenAI 兼容端点,必须带 /v1 |
| API Key | ollama | 任意字符串占位,Ollama 不校验 |
| 模型名称 / Model ID | 例如:qwen2.5-coder-14b-int3 | 必须是 ollama list 里的模型名,不带 :latest 也行 |
3. 保存并验证
保存后模型会出现在模型列表里,选择它即可对话 注意判断该接入的模型是否支持image,若不支持,在高级配置中选择不支持
对话前确认 Ollama 服务在运行(终端 ollama list 能出结果即正常)
注意事项
Ollama 必须已启动:Trae 是直连 localhost:11434,Ollama 没开会报连接失败
模型名严格一致:填错会报 "model not found",用 ollama list 复制完整名字
CORS 不用管:Trae 走服务端/本机直连,不需要像网页版那样开 OLLAMA_ORIGINS
若 Trae 表单里要求填"模型提供方",选OpenAI(兼容协议)
如果 Trae 的"自定义模型"表单字段名不同
一般是 Name / Base URL / API Key 三个,对应关系:Name=模型名、Base URL=http://localhost:11434/v1、API Key=ollama。填完直接保存即可。
四、踩坑与注意事项
1. 下载 SSL 报错处理
报[SSL: UNEXPECTED_EOF_WHILE_READING]是网络瞬时断连,按序处理:
直接重试同一条命令(多数情况成功)
取消镜像直连官方:
Remove-Item Env:HF_ENDPOINT
有代理软件时设置:
$env:HTTPS_PROXY = "http://127.0.0.1:7890"
(端口按代理软件实际配置改)
临时关闭安全软件/换网络(如手机热点)排查
2. 分片文件的 FROM 写法
若下载的 GGUF 是分片(如-00001-of-00002.gguf),Modelfile 的 FROM 只需写第一个分片,llama.cpp/Ollama 自动找其余分片(要求同目录、命名规范)。
3. gguf 源文件删除影响"重建"
ollama create会把 GGUF 复制进 blobs,删除源文件不影响已导入模型运行;但 Modelfile 的 FROM 依赖源路径,删掉后想改Modelfile中的其它配置会重建失败。验证稳定前建议保留源文件。
5. huggingface-cli 已废弃
新版直接使用hf命令;旧命令会提示 deprecated。