Qwen 3.6是第一个真正意义上可以当作通用智能来用的本地模型。
Qwen 3.6 有两个版本可供选择:一个是混合专家模型 Qwen 3.6 35B A3B,速度快但偶尔偏离目标;另一个是稠密型模型 Qwen 3.6 27B,速度稍慢但能力更强。本文推荐的就是后者。
为什么选 27B 而不是 35B A3B?
先看两组实际测试。
用同一句提示词让两个版本各生成一个六边形扫雷游戏:
• 27B 稠密版:一次就成功,仅凭一条提示词生成了完整的 Node 包
• 35B A3B 混合专家版:速度确实更快,但它忽略了我让它创建包的要求,直接输出成单个 HTML 文件
速度快但偏离目标,和稍慢但精准交付之间,27B 赢得很干脆。
环境准备
工具选择:llama.cpp,不是 Ollama
推荐使用 llama.cpp——一个直接、开源、不玩花活儿的工具。Ollama 有它的问题,基于某些原因,我建议不要用。
llama.cpp 的优势:
• 直接管理模型,无中间层黑箱
• 支持draft-mtp(多 token 预测),显著加速推理
• 开源透明,不依赖任何商业公司的服务
获取模型
前往 Hugging Face 下载合适的量化版本。默认模型使用 BF16 精度,体积较大。推荐 8 位量化版本——节省一半空间,质量几乎不受影响。
选择unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0,它支持多 token 预测(MTP),能在推理时加速。
启动服务
一个命令拉起:
llama-server -hf unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0 \ --spec-type draft-mtp -ngl 999 -fa on -c 65536 --jinja --port 8080参数解释:
| 参数 | 含义 |
|---|---|
-hf unsloth/... | 从 Hugging Face 自动下载,后续运行复用缓存 |
--spec-type draft-mtp | 用快速模型预测后续 token,加速生成 |
-ngl 999 | 将所有层加载到 GPU |
-fa on | 开启 Flash Attention |
-c 65536 | 上下文窗口 64K(Qwen 3.6 原生支持 256K,可按需调大) |
--jinja | 启用工具调用支持 |
--port 8080 | 固定端口,便于其他工具对接 |
启动后打开http://127.0.0.1:8080,即可直接在浏览器里对话。
如果只想在终端使用,换llama-cli:
llama-cli -hf unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0 \ -ngl 999 -fa on -c 65536 --jinja接入开发工具:OpenCode
服务跑起来后,接入 OpenCode 只需在~/.config/opencode/opencode.jsonc添加一段配置:
{"$schema":"https://opencode.ai/config.json","provider":{"llama":{"name":"llama.cpp (local)","npm":"@ai-sdk/openai-compatible","options":{"baseURL":"http://127.0.0.1:8080/v1","apiKey":"local"},"models":{"qwen3.6-27b":{"name":"Qwen3.6-27B Q8 +MTP"}}}},"model":"llama/qwen3.6-27b"}配置完成后,OpenCode 就能直接调用本地的 Qwen 3.6 27B 来写代码了。不用 API Key,不花一分钱,延迟极低。
假如你从2026年开始学大模型,按这个步骤走准能稳步进阶。
接下来告诉你一条最快的邪修路线,
3个月即可成为模型大师,薪资直接起飞。
阶段1:大模型基础
阶段2:RAG应用开发工程
阶段3:大模型Agent应用架构
阶段4:大模型微调与私有化部署
配套文档资源+全套AI 大模型 学习资料,朋友们如果需要可以微信扫描下方二维码免费领取【保证100%免费】👇👇