如何用llama.cpp快速部署CodeShell大模型服务:新手5步从编译到启动完整教程
【免费下载链接】codeshell-vscodeAn intelligent coding assistant plugin for Visual Studio Code, developed based on CodeShell项目地址: https://gitcode.com/gh_mirrors/co/codeshell-vscode
用 llama.cpp 部署 CodeShell 大模型服务,无需 GPU 即可让 Visual Studio Code 变身 AI 编程助手。CodeShell 智能编码助手插件支持代码补全、代码解释、代码优化与智能问答,全程本地运行、隐私无忧。本文按"编译 → 下载模型 → 启动服务 → 安装插件 → 配置验证"5 个步骤,手把手带你从零跑通整个流程。
💡 本教程基于开源项目 README.md 的部署说明整理,插件源码位于 src/extension.ts,可放心对照阅读。
第1步:准备工作与编译llama.cpp模型服务
开始之前,请先确认环境满足以下要求:
| 依赖项 | 版本要求 |
|---|---|
| Node.js | v18 及以上 |
| Visual Studio Code | 1.68.1 及以上 |
| CMake + C++ 编译器 | 任意主流版本 |
编译 llama.cpp for CodeShell 项目(该项目提供了 CodeShell 大模型的 4bits 量化推理引擎),不同系统的操作如下:
- Linux / Mac(Apple Silicon):克隆仓库后进入目录执行
make即可。macOS 默认启用 Metal,模型会加载到 GPU 上运行,速度提升明显。 - Mac(非 Apple Silicon):编译时加参数
LLAMA_NO_METAL=1 make禁用 Metal,避免运行时异常。 - Windows:推荐使用 Windows Subsystem for Linux(WSL),按 Linux 的方法编译即可。
第2步:下载CodeShell量化模型文件
本教程使用 4bits 量化版模型codeshell-chat-q4_0.gguf(来自 CodeShell-7B-Chat-int4 模型,体积小、CPU 也能流畅推理),请将其下载到项目的llama_cpp_for_codeshell/models目录下。
第3步:启动模型API服务
在命令行中执行以下命令,即可启动 CodeShell 模型服务:
./server -m ./models/codeshell-chat-q4_0.gguf --host 127.0.0.1 --port 8080参数说明:
-m指定模型文件路径--host/--port指定服务地址,默认监听http://127.0.0.1:8080,与插件的默认设置一致
⚠️ 小提示:macOS 上若编译时启用了 Metal 但运行出现异常,可在命令行追加参数-ngl 0显式关闭 GPU 推理,让模型回落到 CPU 运行。
第4步:编译并安装CodeShell VSCode插件
进入 codeshell-vscode 项目目录,执行以下命令从源码打包插件:
git clone https://link.gitcode.com/i/34aa41d21ef635884523a804edfaa458 cd codeshell-vscode npm install npm exec vsce package执行完成后会得到codeshell-vscode-${VERSION_NAME}.vsix文件。在 VSCode 扩展面板中执行Install from VSIX...命令,选择该文件即可完成插件安装。
第5步:配置插件连接模型服务并验证
打开 VSCode 设置(Ctrl/Cmd + ,),搜索CodeShell,重点配置以下两项:
- Code Shell: Server Address:填写
http://127.0.0.1:8080(与第3步启动的地址保持一致,默认值即为此) - Code Shell: Run Env For LLMs:选择
CPU with llama.cpp
此外还可以按需调整:自动触发补全开关(Auto Trigger Completion)、自动触发延迟(Auto Completion Delay,1~3 秒)、补全与问答的最大 tokens 数量。这些配置的读取逻辑可在 src/consts.ts 中查看。
功能验证一:AI代码补全
开始编写代码,停止输入约 1 秒后,灰色建议就会出现在光标位置,按Tab接受,或继续输入忽略。也可以按快捷键Alt+\(Windows)或Option+\(Mac)手动触发,补全请求由 src/request/inline-completion.ts 发送到你刚刚启动的 llama.cpp 服务。
功能验证二:代码解释、优化与安全检查
在编辑器中选中一段代码,右键选择CodeShell子菜单,即可让模型执行"解释这段代码、优化这段代码、清理这段代码、生成注释、生成单元测试、检查性能问题、检查安全问题"等操作,答案会显示在侧边栏问答界面中。
功能验证三:智能多轮问答
点击活动栏的 CodeShell 图标打开问答面板,支持多轮对话与会话历史;回答中的代码块可一键复制,或直接插入到编辑器光标处。
常见问题速查
| 现象 | 原因与解决办法 |
|---|---|
| 插件无响应、提示请求超时 | 模型服务未启动,先确认第3步的server进程正在运行 |
| macOS 编译后运行报 Metal 相关错误 | 追加-ngl 0参数关闭 GPU 推理 |
| 非 Apple Silicon 的 Mac 运行异常 | 重新编译时加LLAMA_NO_METAL=1 |
| 补全建议过长/过短 | 在插件设置中调整Completion Max Tokens(64~1024) |
🎉 恭喜!至此你已经用 llama.cpp 在本地跑通了 CodeShell 大模型服务,并让 VSCode 拥有了代码补全、代码辅助与智能问答三大 AI 能力。更多功能细节可参考 src/extension.ts 与 README.md。
【免费下载链接】codeshell-vscodeAn intelligent coding assistant plugin for Visual Studio Code, developed based on CodeShell项目地址: https://gitcode.com/gh_mirrors/co/codeshell-vscode
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考