Claude Code Router:3 步接入本地模型,把编码请求路由给合适的模型
【免费下载链接】claude-code-routerOne local control plane for every AI agent: route across models, fuse new capabilities, orchestrate tools, and stay fully in control.项目地址: https://gitcode.com/GitHub_Trending/cl/claude-code-router
你让 Claude Code 补全一段 while 循环,它实际调用的是哪家云的什么模型?Claude Code Router 就是一个本地的多模型路由网关:所有 Agent 的请求都先经过它,简单任务交给本地模型,硬任务再走云端强模型。
它到底是什么:Agent 前面的本地网关
它不是模型,也不是客户端,而是坐在 Agent 和模型之间的网关。Claude Code、Codex 这些客户端统一指向一个本地地址,背后具体由哪个供应商、哪个模型、哪个账号接单,全由你决定。换模型时不用动客户端配置。
从零到跑通:装服务、接模型、写规则
拉代码并启动服务
git clone https://gitcode.com/GitHub_Trending/cl/claude-code-router cd claude-code-router && docker compose up -d --build打开http://127.0.0.1:3458是管理页面,模型网关监听 3456 端口。不想用 Docker 的话,桌面应用和 npm CLI 也走同一套流程(全局装包后执行ccr ui),详见 docker/README.md。
接上你的第一个本地模型
ollama serve ollama pull qwen2.5-coder:latest在 Providers 页面点 Add Provider,选自定义 OpenAI 兼容端点,地址填http://localhost:11434/v1/chat/completions。顺手再加一个云端供应商做兜底。
写第一条路由规则
在 Routing 页面点添加:条件选request.body、字段填model,把模型改写成ollama/qwen2.5-coder:latest,其余情况保持默认。保存后发一次请求,到 Logs 页面看是否真的命中了本地模型。
多模型路由策略怎么设计:按任务类型选模型
别先背界面字段,先按"任务类型 → 该交给谁"想清楚:
- 代码补全、格式化、简单修改 → 本地便宜模型
- 复杂推理、跨文件重构 → 云端强模型
- 读长文档、整理大量日志 → 长上下文模型
- 子代理、后台任务 → 快速便宜模型
- 需要看图或联网搜索 → Fusion 组合模型
两个典型场景值得展开。一是后台任务:Claude Code 内部做摘要、维护状态时会发大量轻量请求,不配路由的话它们全落在默认的大模型上,费钱且没必要,指给一个快而便宜的模型就能省下来。二是子代理:CCR 支持在模型页给每个模型写 Description(比如"适合代码搜索和简单修改"),Claude Code 派生子任务时会据此选模型,主请求留在强模型上,子任务跑便宜模型。另外记住一条原则:规则从上到下匹配、第一条命中生效,具体规则放前面,兜底规则放最后。
钱花在哪、省在哪:云端与本地成本对比
| 任务类型 | 云端成本(单次) | 本地成本(单次) |
|---|---|---|
| 日常代码补全 | $0.10 | $0.001 |
| 简单问题解答 | $0.05 | $0.0005 |
| 复杂算法设计 | $0.20 | $0.20 |
| 文档代码审查 | $0.15 | $0.15 |
按每天 100 次调用算,月省大约 $59。硬任务仍要走云端模型,关键是把大多数不需要强推理的请求划给本地。Overview 页面能看到每天的 token 数和估算成本,跑几天后省了多少自己心里有数。
进阶玩法:Fusion 组合模型与请求日志
模型本身不会看图,但你想做图像理解,就用 Fusion:在 Fusion 页面把文本模型和视觉、联网搜索或 MCP 工具组合成一个新模型,Agent 直接选用,客户端不用改。请求表现不符合预期时,去 Logs 页面核对每条请求最终命中的供应商、模型、token、耗时和成本;在设置里打开 Agent 观测,还能看到完整的执行链路。实在拿不准路由改了什么,打开调试界面直接看发出去的原始请求。
踩坑速查:5 个最常见的卡点
- Agent 没走 CCR,日志里没有记录 →
curl http://127.0.0.1:3456/health确认网关是否在运行 → 在服务页面启动网关,且 Agent 要从 CCR 里启动 - 供应商返回 401/403 → 在供应商页面跑一次模型连通性检查 → 逐字核对 API Key 和 Base URL
- 报
model not found→ 对比供应商模型列表、路由规则、Agent 配置三处的模型名 → 改一致 - 请求命中了错误模型 → 在请求日志里对比 request model 和 resolved model → 调整规则顺序,第一条命中生效
- Ollama 连不上 →
curl http://localhost:11434/v1/models看是否返回模型列表 → 确认 Ollama 服务在运行
更多问题可查 docs/src/content/docs/zh/troubleshooting.md。 下次再让 Claude Code 补全 while 循环时,请求会先落到你本机的 3456 端口,再由你写的规则分发。现在就做两件事:docker compose up -d --build把服务拉起来,然后写第一条指向qwen2.5-coder的路由规则,第二天打开日志页看成本栏,就知道省下了多少。
【免费下载链接】claude-code-routerOne local control plane for every AI agent: route across models, fuse new capabilities, orchestrate tools, and stay fully in control.项目地址: https://gitcode.com/GitHub_Trending/cl/claude-code-router
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考