☰
Claude Code Router:3 步接入本地模型,把编码请求路由给合适的模型
2026/9/27 9:58:32 网站建设 项目流程

Claude Code Router:3 步接入本地模型,把编码请求路由给合适的模型

【免费下载链接】claude-code-routerOne local control plane for every AI agent: route across models, fuse new capabilities, orchestrate tools, and stay fully in control.项目地址: https://gitcode.com/GitHub_Trending/cl/claude-code-router

你让 Claude Code 补全一段 while 循环,它实际调用的是哪家云的什么模型?Claude Code Router 就是一个本地的多模型路由网关:所有 Agent 的请求都先经过它,简单任务交给本地模型,硬任务再走云端强模型。

它到底是什么:Agent 前面的本地网关

它不是模型,也不是客户端,而是坐在 Agent 和模型之间的网关。Claude Code、Codex 这些客户端统一指向一个本地地址,背后具体由哪个供应商、哪个模型、哪个账号接单,全由你决定。换模型时不用动客户端配置。

从零到跑通:装服务、接模型、写规则

拉代码并启动服务

git clone https://gitcode.com/GitHub_Trending/cl/claude-code-router cd claude-code-router && docker compose up -d --build

打开http://127.0.0.1:3458是管理页面,模型网关监听 3456 端口。不想用 Docker 的话,桌面应用和 npm CLI 也走同一套流程(全局装包后执行ccr ui),详见 docker/README.md。

接上你的第一个本地模型

ollama serve ollama pull qwen2.5-coder:latest

在 Providers 页面点 Add Provider,选自定义 OpenAI 兼容端点,地址填http://localhost:11434/v1/chat/completions。顺手再加一个云端供应商做兜底。

写第一条路由规则

在 Routing 页面点添加:条件选request.body、字段填model,把模型改写成ollama/qwen2.5-coder:latest,其余情况保持默认。保存后发一次请求,到 Logs 页面看是否真的命中了本地模型。

多模型路由策略怎么设计:按任务类型选模型

别先背界面字段,先按"任务类型 → 该交给谁"想清楚:

  • 代码补全、格式化、简单修改 → 本地便宜模型
  • 复杂推理、跨文件重构 → 云端强模型
  • 读长文档、整理大量日志 → 长上下文模型
  • 子代理、后台任务 → 快速便宜模型
  • 需要看图或联网搜索 → Fusion 组合模型

两个典型场景值得展开。一是后台任务:Claude Code 内部做摘要、维护状态时会发大量轻量请求,不配路由的话它们全落在默认的大模型上,费钱且没必要,指给一个快而便宜的模型就能省下来。二是子代理:CCR 支持在模型页给每个模型写 Description(比如"适合代码搜索和简单修改"),Claude Code 派生子任务时会据此选模型,主请求留在强模型上,子任务跑便宜模型。另外记住一条原则:规则从上到下匹配、第一条命中生效,具体规则放前面,兜底规则放最后。

钱花在哪、省在哪:云端与本地成本对比

任务类型云端成本(单次)本地成本(单次)
日常代码补全$0.10$0.001
简单问题解答$0.05$0.0005
复杂算法设计$0.20$0.20
文档代码审查$0.15$0.15

按每天 100 次调用算,月省大约 $59。硬任务仍要走云端模型,关键是把大多数不需要强推理的请求划给本地。Overview 页面能看到每天的 token 数和估算成本,跑几天后省了多少自己心里有数。

进阶玩法:Fusion 组合模型与请求日志

模型本身不会看图,但你想做图像理解,就用 Fusion:在 Fusion 页面把文本模型和视觉、联网搜索或 MCP 工具组合成一个新模型,Agent 直接选用,客户端不用改。请求表现不符合预期时,去 Logs 页面核对每条请求最终命中的供应商、模型、token、耗时和成本;在设置里打开 Agent 观测,还能看到完整的执行链路。实在拿不准路由改了什么,打开调试界面直接看发出去的原始请求。

踩坑速查:5 个最常见的卡点

  • Agent 没走 CCR,日志里没有记录 →curl http://127.0.0.1:3456/health确认网关是否在运行 → 在服务页面启动网关,且 Agent 要从 CCR 里启动
  • 供应商返回 401/403 → 在供应商页面跑一次模型连通性检查 → 逐字核对 API Key 和 Base URL
  • 报model not found→ 对比供应商模型列表、路由规则、Agent 配置三处的模型名 → 改一致
  • 请求命中了错误模型 → 在请求日志里对比 request model 和 resolved model → 调整规则顺序,第一条命中生效
  • Ollama 连不上 →curl http://localhost:11434/v1/models看是否返回模型列表 → 确认 Ollama 服务在运行

更多问题可查 docs/src/content/docs/zh/troubleshooting.md。 下次再让 Claude Code 补全 while 循环时,请求会先落到你本机的 3456 端口,再由你写的规则分发。现在就做两件事:docker compose up -d --build把服务拉起来,然后写第一条指向qwen2.5-coder的路由规则,第二天打开日志页看成本栏,就知道省下了多少。

【免费下载链接】claude-code-routerOne local control plane for every AI agent: route across models, fuse new capabilities, orchestrate tools, and stay fully in control.项目地址: https://gitcode.com/GitHub_Trending/cl/claude-code-router

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询