☰
基于 Ollama 部署 qwen2.5-coder-14b(GGUF 直下版)
2026/9/26 4:16:30 网站建设 项目流程

与Ollama相关的文章可见Ollama :大模型本地部署与轻量化优化-CSDN博客

操作步骤

适用场景:本地编码模型部署,接入 opencode、Trea中 使用

一、前置准备

  1. Python 虚拟环境(可选):D:\venv_all
    可创建一个虚拟环境py 3.12 -m venv venv_all
    然后pip install torch transformers sentencepiece protobuf gguf

  2. 官方下载地址:Ollama
    国内镜像地址: Ollama - Ollama 框架

  3. 模型下载目录:D:\models\qwen2.5-coder-14b-gguf(地址自行选择)

  4. 工具说明:本次走"下载官方现成 GGUF"路径,无需llama.cpp 的 convert/quantize 步骤

三、完整操作步骤

步骤 1:激活虚拟环境

在powershell中激活虚拟环境

D:\venv_all\Scripts\Activate.ps1
  • 成功标志:提示符前出现(venv_all)

  • 若报"禁止运行脚本",先执行Set-ExecutionPolicy -Scope Process Bypass再激活

步骤 2:安装下载工具 (非必选项)

谨慎执行该命令,该命令会让huggingface_hub更新为最新版本,可能会与环境中的其它库包造成版本冲突

python -m pip install -U huggingface_hub

注:新版huggingface-cli命令已废弃,一律使用hf命令

步骤 3:设置国内镜像加速

$env:HF_ENDPOINT = "https://hf-mirror.com"

步骤 4:查看仓库文件列表(确认档位)

hf download Qwen/Qwen2.5-Coder-14B-Instruct-GGUF --dry-run

官方仓库文件列表确认结果(2026-09-24): 不同量化精度的模型

文件大小
qwen2.5-coder-14b-instruct-q3_k_m.gguf7.3 G
qwen2.5-coder-14b-instruct-q4_k_m-00001-of-00002.gguf8.0 G + 987.7M
qwen2.5-coder-14b-instruct-q4_0.gguf8.5 G
qwen2.5-coder-14b-instruct-fp16.gguf29.5 G
其余 Q2_K / Q5_K_M / Q6_K / Q8_05.8~15.7 G

步骤 5:下载 Q3_K_M(约 7.3 GB)

结合自己电脑的配置(内层、显卡大小)选择合适的

hf download Qwen/Qwen2.5-Coder-14B-Instruct-GGUF --include "*q3_k_m*" --local-dir D:\models\qwen2.5-coder-14b-gguf
  • --include用小写*q3_k_m*(文件名小写),只匹配目标文件

  • 下载完成标准:D:\models\qwen2.5-coder-14b-gguf\qwen2.5-coder-14b-instruct-q3_k_m.gguf存在且约 7.3 GB

  • 断网重跑同一条命令自动续传

步骤 6:写 Modelfile

在D:\models\qwen2.5-coder-14b-gguf新建Modelfile-coder14b(记事本,编码选 UTF-8):

FROM D:\models\qwen2.5-coder-14b-gguf\qwen2.5-coder-14b-instruct-q3_k_m.gguf PARAMETER temperature 0.7 PARAMETER top_p 0.9 PARAMETER num_ctx 8192

步骤 7:导入 Ollama

ollama create qwen2.5-coder-14b -f D:\models\qwen2.5-coder-14b-gguf\Modelfile-coder14b
  • 成功标志:输出success

  • 会自动将 GGUF 复制进.ollama\models\blobs(D 盘再占约 7.3 GB)

步骤 8:验证

ollama list ollama run qwen2.5-coder-14b "用Python写一个快速排序,只给代码" ollama ps

验收标准:ollama ps该模型的SIZE 约 7.3 GB。

步骤 9:接入 opencode

编辑opencode.jsonc,在 ollama provider 的 models 里添加:

{ "name": "qwen2.5-coder-14b", "baseURL": "http://localhost:11434/v1" }
  • baseURL 必须带/v1,apiKey 随意占位(Ollama 不校验)

在trae中接入模型

1. 打开添加模型对话框

设置 → 模型 → 添加模型,选择自定义模型

2. 填写连接参数(OpenAI 兼容三件套)

字段填写值说明
API 地址 / Base URLhttp://localhost:11434/v1Ollama 的 OpenAI 兼容端点,必须带 /v1
API Keyollama任意字符串占位,Ollama 不校验
模型名称 / Model ID例如:qwen2.5-coder-14b-int3必须是 ollama list 里的模型名,不带 :latest 也行

3. 保存并验证

  • 保存后模型会出现在模型列表里,选择它即可对话 注意判断该接入的模型是否支持image,若不支持,在高级配置中选择不支持

  • 对话前确认 Ollama 服务在运行(终端 ollama list 能出结果即正常)

注意事项

  1. Ollama 必须已启动:Trae 是直连 localhost:11434,Ollama 没开会报连接失败

  2. 模型名严格一致:填错会报 "model not found",用 ollama list 复制完整名字

  3. CORS 不用管:Trae 走服务端/本机直连,不需要像网页版那样开 OLLAMA_ORIGINS

  4. 若 Trae 表单里要求填"模型提供方",选OpenAI(兼容协议)

如果 Trae 的"自定义模型"表单字段名不同

一般是 Name / Base URL / API Key 三个,对应关系:Name=模型名、Base URL=http://localhost:11434/v1、API Key=ollama。填完直接保存即可。

四、踩坑与注意事项

1. 下载 SSL 报错处理

报[SSL: UNEXPECTED_EOF_WHILE_READING]是网络瞬时断连,按序处理:

  1. 直接重试同一条命令(多数情况成功)

  2. 取消镜像直连官方:

    Remove-Item Env:HF_ENDPOINT
  3. 有代理软件时设置:

    $env:HTTPS_PROXY = "http://127.0.0.1:7890"

    (端口按代理软件实际配置改)

  4. 临时关闭安全软件/换网络(如手机热点)排查

2. 分片文件的 FROM 写法

若下载的 GGUF 是分片(如-00001-of-00002.gguf),Modelfile 的 FROM 只需写第一个分片,llama.cpp/Ollama 自动找其余分片(要求同目录、命名规范)。

3. gguf 源文件删除影响"重建"

ollama create会把 GGUF 复制进 blobs,删除源文件不影响已导入模型运行;但 Modelfile 的 FROM 依赖源路径,删掉后想改Modelfile中的其它配置会重建失败。验证稳定前建议保留源文件。

5. huggingface-cli 已废弃

新版直接使用hf命令;旧命令会提示 deprecated。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询