Skill Seekers 完全指南:将文档网站、GitHub 仓库与 PDF 一键转化为 AI 可用的结构化技能资产
2026/9/23 2:02:54 网站建设 项目流程
  • 人工智能
  • AI 应用
  • AI 技能
  • RAG
  • MCP 服务
  • 网页爬虫

【免费下载链接】Skill_Seekers

Convert documentation websites, GitHub repositories, and PDFs into Claude AI skills with automatic conflict detection

项目地址:https://gitcode.com/gh_mirrors/sk/Skill_Seekers
点击查看免费下载

导读

Skill Seekers 是一个面向 AI 系统的"数据层"开源项目:它把文档网站、GitHub 仓库、PDF、视频、Notebook、Wiki 等18 种来源统一转化为结构化知识资产,并导出到 Claude、Gemini、OpenAI 等 AI 技能平台,以及 LangChain、LlamaIndex、Pinecone 等 RAG 管道与 Cursor、Windsurf、Cline 等 AI 编码助手(共22 个导出目标)。读完本文,你将掌握从安装、抓取、AI 增强到打包、上传、安装进各类 Agent 的完整实战链路,并理解其背后基于SkillAdaptor抽象与统一调度器的源码实现原理。


1. 项目定位:一次准备,多处使用

Skill Seekers 的核心定位是"The data layer for AI systems"(AI 系统的数据层)。它并不直接提供模型,而是负责把人类可读的文档/代码/资料,加工成 AI 可以直接消费的结构化知识资产:

使用场景输出物服务对象
AI Skills完整的SKILL.md+ 参考文件Claude Code、Gemini、GPT
RAG 管道带丰富元数据的分块文档LangChain、LlamaIndex、Haystack
向量数据库可直接 upsert 的预格式化数据Pinecone、Chroma、Weaviate、FAISS、Qdrant
AI 编码助手IDE AI 自动读取的上下文文件Cursor、Windsurf、Cline、Continue.dev

这一"一次准备、四处消费"的设计,意味着抓取和增强工作只需要做一遍,随后任意目标平台都可以直接复用,无需重新抓取。


2. 安装:按需选择 extras

项目要求Python 3.10+与 Git。基础安装极其简单:

pip install skill-seekers # 核心:抓取、GitHub、PDF、打包 pip install skill-seekers[all-llms] # + 所有 LLM 平台 pip install skill-seekers[mcp] # + MCP 服务器 pip install skill-seekers[all] # 全部

如果拿不准需要哪些能力,可以直接运行配置向导:

skill-seekers-setup

项目的安装 extras 采用"按需扩展"策略,下表来自 README.md 并对应仓库内的实现模块:

安装项额外能力
skill-seekers[gemini]Google Gemini 支持
skill-seekers[openai]OpenAI ChatGPT 支持
skill-seekers[all-llms]全部 LLM 平台
skill-seekers[mcp]面向 Claude Code、Cursor 等的 MCP 服务器
skill-seekers[video]YouTube/Vimeo 字幕与元数据提取
skill-seekers[video-full]额外包含 Whisper 转录与视觉帧提取
skill-seekers[jupyter]Jupyter Notebook 支持
skill-seekers[pptx]PowerPoint 支持
skill-seekers[confluence]Confluence wiki 支持
skill-seekers[notion]Notion 页面支持
skill-seekers[rss]RSS/Atom feed 支持
skill-seekers[chat]Slack/Discord 聊天导出支持
skill-seekers[asciidoc]AsciiDoc 支持
skill-seekers[all]全部

提示:视频视觉依赖是 GPU 感知的。安装skill-seekers[video-full]后,执行skill-seekers create --setup会自动检测 GPU 并安装匹配的 PyTorch 变体与 easyocr。

新手可先阅读 Bulletproof Quick Start 快速上手。


3. 快速开始:3 条命令产出第一个 Skill

Skill Seekers 的完整工作流只需三条命令:

# 1. 安装 pip install skill-seekers # 2. 从任意来源创建技能(自动检测来源类型) skill-seekers create https://docs.djangoproject.com/ # 可选:在不创建任何内容的前提下预览来源的检测结果 skill-seekers detect https://docs.djangoproject.com/ --json # 3. 为你的 AI 平台打包 skill-seekers package output/django --target claude

执行完毕后,当前目录下会得到output/django-claude.zip,一个开箱即用的 Claude Skill。

默认 AI 增强代理是claude,也可以随时切换:

skill-seekers create https://docs.djangoproject.com/ --agent kimi skill-seekers create https://docs.djangoproject.com/ --agent-cmd "my-custom-agent run"

其中--agent-cmd允许接入任意自定义 CLI 代理,为无法直接调用 API 的场景提供了灵活性。

3.1 源码视角:统一的命令分发入口

从源码看,所有命令都汇入同一个入口 src/skill_seekers/cli/main.py:createdetectscandoctorui采用类式分发(Command(args).execute()),其余命令(enhancepackageuploadinstallestimatequalityworkflowsstreamupdate等)通过模块映射分发。这种统一分发表意味着每个子命令既可独立作为skill-seekers-<cmd>入口运行,也能共享主解析器参数。


4. 自动检测:detect与来源类型判断

skill-seekers detect <source> --json用于不落地任何产物地预览来源类型识别结果,非常适合脚本化调用或在 CI 中确认输入类型。

自动检测由 src/skill_seekers/cli/source_detector.py 中的SourceDetector类实现:它通过 GitHub 仓库名正则(owner/repo模式与github.com/...URL 模式)识别仓库来源,并结合 URL、扩展名与本地路径特征识别 web、local、PDF、config 等类型。值得注意的是,从源码注释可以看出,Confluence、Notion、Slack/Discord 聊天这类基于 API/导出的来源无法从单个参数自动推断,需要走各自专属的子命令(--space-key--database-id--chat-export-path等)。


5. 全部 18 种来源类型

Skill Seekers 的create命令对输入做统一检测,只需把不同类型的源直接当作参数传入:

skill-seekers create facebook/react # GitHub 仓库 skill-seekers create ./my-project # 本地代码库 skill-seekers create manual.pdf # PDF skill-seekers create report.docx # Word skill-seekers create book.epub # EPUB skill-seekers create notebook.ipynb # Jupyter skill-seekers create openapi.yaml # OpenAPI/Swagger skill-seekers create presentation.pptx # PowerPoint skill-seekers create guide.adoc # AsciiDoc skill-seekers create page.html # 本地 HTML(或整个目录) skill-seekers create feed.rss # RSS/Atom skill-seekers create curl.1 # Man page # 视频(YouTube、Vimeo 或本地文件——需要 skill-seekers[video]) skill-seekers create --video-url https://www.youtube.com/watch?v=... --name mytutorial skill-seekers create --setup # 自动安装 GPU 感知的视觉依赖 skill-seekers create --space-key TEAM --name wiki # Confluence skill-seekers create --database-id ... --name docs # Notion skill-seekers create --chat-export-path ./slack-export --name team-chat # Slack/Discord

每种来源的详细参数见 Scraping Guide。

5.1 源码视角:统一调度的来源分派表

从 src/skill_seekers/cli/unified_scraper.py 的SOURCE_DISPATCH可以看到,多来源抓取是同一套调度逻辑:documentationgithubpdfwordvideolocalepubjupyterhtmlopenapiasciidocpptxconfluencenotionrssmanpagechat各映射到独立的_scrape_*处理函数,形成"一个统一入口、按类型分发"的架构。


6. AI 驱动的项目扫描:scan

scan命令面向已有代码项目:让一个 AI 代理读取项目的 manifests、README、Dockerfile/CI 以及采样源码导入语句,然后为检测到的每个框架各生成一份配置,外加一份针对你自己代码的<project>-codebase.json

skill-seekers scan ./my-react-app --out ./configs/scanned/ # → react.json, vite.json, tailwind.json, jest.json, my-react-app-codebase.json skill-seekers create ./configs/scanned/react.json

如果某个检测结果没有现成预设,AI 会现场生成全新配置;退出时还可选择将配置发布回社区注册表。仓库 configs/ 目录中已经存放了多份真实可用的配置示例(如 react.json、godot_unified.json、unity-spine.json 等),可直接作为skill-seekers create configs/xxx.json的输入。


7. 多来源统一配置:一份 config 抓取整个知识域

create也可以直接接收一份 JSON 配置文件,一次性聚合多个来源。以仓库内置的 configs/react.json 为例,它同时包含documentation(react.dev 官网,带 CSS 选择器、URL 排除规则、主题分类与限速)和github(facebook/react 源码仓库,开启代码库分析、issue 与 release 抓取)两类来源:

{ "name": "react", "description": "Complete React knowledge base combining official documentation and React codebase insights.", "version": "1.1.0", "merge_mode": "rule-based", "sources": [ { "type": "documentation", "base_url": "https://react.dev/", "extract_api": true, "selectors": { "main_content": "article", "title": "h1", "code_blocks": "pre code" }, "url_patterns": { "include": [], "exclude": ["/blog/", "/community/"] }, "categories": { "getting_started": ["learn", "installation", "quick-start"], "components": ["components", "props", "state"], "hooks": ["hooks", "usestate", "useeffect", "usecontext"], "api": ["api", "reference"], "advanced": ["context", "refs", "portals", "suspense"] }, "rate_limit": 0.5 }, { "type": "github", "repo": "facebook/react", "enable_codebase_analysis": true, "code_analysis_depth": "deep", "fetch_issues": true, "max_issues": 100, "fetch_changelog": true, "fetch_releases": true, "file_patterns": [ "packages/react/src/**/*.js", "packages/react-dom/src/**/*.js" ] } ], "base_url": "https://react.dev/" }

merge_mode支持rule-basedai-enhanced两种合并策略(后者对应源码中的AIEnhancedMerger,前者对应RuleBasedMerger,均位于 src/skill_seekers/cli/merge_sources.py)。多来源会先经过冲突检测器(conflict_detector.py)识别来源间的冲突,再进行跨来源配对合成。完整配置格式见 CONFIG_FORMAT.md,统一抓取细节见 UNIFIED_SCRAPING.md。


8. AI 增强:API 模式与 LOCAL 模式

所有 AI 调用都通过同一条传输通道完成,支持两种模式:

  • API 模式:Anthropic、Google Gemini、OpenAI、Moonshot/Kimi、MiniMax,直接调用云端模型;
  • LOCAL 模式:Claude Code、Kimi Code、Codex、Copilot、OpenCode 或自定义代理,无 API 费用。

增强深度由--enhance-level 0-3控制,代理选择由--agent指定。最终产出通常是500 行以上、包含示例、模式与指南的SKILL.md

skill-seekers create ./my-project --preset quick # 1–2 分钟,浅层 skill-seekers create ./my-project --preset standard # 均衡(默认) skill-seekers create ./my-project --preset comprehensive # 深度、穷尽

GitHub/代码库分析采用C3.x 三流架构:代码流(AST、设计模式、测试)、文档流(README、docs/、wiki)、社区流(issues、PRs、元数据),并内置跨 9 种语言的 10 个 GoF 模式检测器。相关深度文档:

  • Enhancement Guide · Enhancement Modes · Multi-Agent Setup
  • Pattern Detection · How-To Guides · Test Example Extraction

9. 打包导出:22 个目标平台

package负责把加工好的目录打包成各平台可识别的产物:

skill-seekers package output/react --target claude # → Claude Skill(ZIP + YAML) skill-seekers package output/react --target langchain # → LangChain Documents skill-seekers package output/react --target llama-index # → LlamaIndex TextNodes skill-seekers package output/react --target ibm-bob # → IBM Bob skill 目录

完整目标分类如下:

  • LLM 平台(12 个)claude·gemini·openai·minimax·opencode·kimi·deepseek·qwen·openrouter·together·fireworks·markdown
  • RAG 与向量库(8 个)langchain·llama-index·haystack·chroma·faiss·weaviate·qdrant·pinecone
  • 其他(2 个)atlas·ibm-bob

各平台支持细节见 Feature Matrix。

9.1 源码视角:SkillAdaptor抽象基类

22 个目标之所以能共享同一套上游产物,是因为它们都实现同一个抽象接口 src/skill_seekers/cli/adaptors/base.py 中的SkillAdaptorABC:每个适配器负责平台特定的SKILL.md格式化、打包结构(ZIP、tar.gz 等)、上传端点与鉴权,以及可选的 AI 增强能力。仓库adaptors/目录下的 20+ 个文件(claude.pygemini.pyopenai.pylangchain.pyqdrant.pyweaviate.py等)即对应全部导出目标。抓取与增强只需一次,打包时按需选择适配器即可。


10. 技能内的搜索索引(可选)

skill-seekers create <source> --index会在生成的技能目录中加入仅依赖标准库的scripts/search.py,并基于生成的参考文件构建SQLite FTS5 全文索引。这样 Agent 在通读大型 Markdown 之前,可以先通过检索定位到正确的file#anchor,显著降低大文档场景的 token 开销。该功能默认关闭,且不会改动原始 Markdown 内容。详见 Skill Search Index。


11. MCP 集成:40 个工具,面向主流 IDE

Skill Seekers 自带 MCP 服务器,可接入 Claude Code、Cursor、Windsurf、VS Code + Cline、IntelliJ IDEA 等环境:

# stdio 模式(Claude Code、VS Code + Cline) python -m skill_seekers.mcp.server_fastmcp # HTTP 模式(Cursor、Windsurf、IntelliJ) python -m skill_seekers.mcp.server_fastmcp --transport http --port 8765

启动后即可直接用自然语言驱动整个流水线,例如:"Package and upload the React skill."。从 src/skill_seekers/mcp/server_fastmcp.py 的模块说明可以看到,工具按功能划分为配置类(generate_configlist_configsvalidate_config)、抓取类(scrape_docsscrape_githubscrape_pdfscrape_video等)、打包类(package_skillupload_skillenhance_skillinstall_skill)、拆分类、来源管理类、市场类与向量库导出类。HTTP 传输的详细用法见 HTTP_TRANSPORT.md。


12. 安装到 19 个 AI 编码代理

生成的技能可一键安装进19 个 AI 编码代理

skill-seekers install-agent output/react/ --agent cursor skill-seekers install-agent output/react/ --agent all # 安装到所有检测到的代理 skill-seekers install-agent output/react/ --agent cursor --dry-run

安装位置与作用域对应关系如下(摘自 README.md):

代理路径作用域
Claude Code~/.claude/skills/全局
Cursor.cursor/skills/项目
VS Code / Copilot.github/skills/项目
Amp~/.amp/skills/全局
Goose~/.config/goose/skills/全局
OpenCode~/.opencode/skills/全局
Letta~/.letta/skills/全局
Aide~/.aide/skills/全局
Windsurf~/.windsurf/skills/全局
Neovate~/.neovate/skills/全局
Roo Code.roo/skills/项目
Cline.cline/skills/项目
Aider~/.aider/skills/全局
Bolt.bolt/skills/项目
Kilo Code.kilo/skills/项目
Continue~/.continue/skills/全局
Kimi Code~/.kimi/skills/全局
IBM Bob.bob/skills/项目

12.1 上传到 Claude

export ANTHROPIC_API_KEY=sk-ant-... skill-seekers package output/react/ --upload # 打包并上传 skill-seekers upload output/react.zip # 上传已存在的 zip

没有 API Key 时,也可以打包后手动把output/react.zip上传到 claude.ai/skills。完整流程见 Upload Guide。


13. 工作原理:五步流水线与 8 大核心模块

README 中给出了端到端流水线(Scrape → Categorize → Enhance → Package → Upload):

  1. Scrape——提取每个页面(优先检查llms.txt);
  2. Categorize——把内容组织成主题(API、指南、教程等);
  3. Enhance——AI 撰写带示例的完整SKILL.md
  4. Package——打包为平台就绪产物;
  5. Upload——(可选)投递到你的 AI 平台。

架构上由8 个核心模块 + 5 个工具模块(约 200 个类)组成:

模块职责
CLICoreGit 风格命令分发器、来源自动检测
Scrapers18 种来源类型的提取器,共享同一构建层
Adaptors22 种输出平台格式,统一实现SkillAdaptorABC
AnalysisC3.x 代码库流水线、10 个 GoF 模式检测器
Enhancement通过单一AgentClient传输通道完成 AI 增强
Packaging打包、上传与安装技能
MCPFastMCP 服务器(40 个工具、10 个工具模块)
Sync文档变更检测与通知

深度内容见 UML Architecture(含 14 张 UML 图)、API Reference 与 Skill Architecture。


14. 质量、同步与规模

14.1 质量门槛

skill-seekers quality output/react/ --threshold 7 # 质量评分 + 门槛 skill-seekers quality output/react/ --json # JSON 输出,供 CI 使用

同时提供面向英文的可读性指标(仅作参考,不影响最终分数)。详见 CODE_QUALITY.md。

14.2 文档变更同步与超大规模处理

  • sync-config用于检测配置漂移;
  • 支持文档变更检测、定时重抓取与通知;
  • 对超大规模文档集(1 万–4 万+ 页)提供流式摄入(stream)与增量更新(update),详见 Large Documentation。

14.3 性能参考(来自 README)

文档规模耗时输出体积
小(< 100 页)5–10 分钟~2 MB
中(100–500 页)15–30 分钟~10 MB
大(500–2,000 页)30–60 分钟~40 MB
超大(10K–40K+ 页)使用stream见 LARGE_DOCUMENTATION

15. 故障排查

skill-seekers doctor # 诊断安装与环境 skill-seekers doctor --json # 机器可读诊断,供 CI 与 Agent 使用 skill-seekers sync-config # 检测配置漂移

常见问题见 Troubleshooting Guide 与 TROUBLESHOOTING.md。


16. 小结

Skill Seekers 用一个统一的数据处理流水线,把"把文档变成 AI 技能"这件事从数天的人工整理压缩到十几分钟:来源自动检测 → 多源统一抓取 → 冲突检测与合并 → AI 增强 → 22 目标打包 → 一键安装/上传。其可扩展性来自两处源码设计:SkillAdaptor抽象(新平台只需新增一个适配器)与统一的命令/来源分派表(src/skill_seekers/cli/main.py、src/skill_seekers/cli/unified_scraper.py)。本文覆盖的完整命令索引见 CLI_REFERENCE.md,更多集成方案(LangChain、RAG Pipelines、Cursor、Windsurf、Cline)见 docs/integrations 目录。

  • 人工智能
  • AI 应用
  • AI 技能
  • RAG
  • MCP 服务
  • 网页爬虫

【免费下载链接】Skill_Seekers

Convert documentation websites, GitHub repositories, and PDFs into Claude AI skills with automatic conflict detection

项目地址:https://gitcode.com/gh_mirrors/sk/Skill_Seekers
点击查看免费下载

相关推荐

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询