- 人工智能
- AI 应用
- AI 技能
- RAG
- MCP 服务
- 网页爬虫
【免费下载链接】Skill_Seekers
Convert documentation websites, GitHub repositories, and PDFs into Claude AI skills with automatic conflict detection
导读
Skill Seekers 是一个面向 AI 系统的"数据层"开源项目:它把文档网站、GitHub 仓库、PDF、视频、Notebook、Wiki 等18 种来源统一转化为结构化知识资产,并导出到 Claude、Gemini、OpenAI 等 AI 技能平台,以及 LangChain、LlamaIndex、Pinecone 等 RAG 管道与 Cursor、Windsurf、Cline 等 AI 编码助手(共22 个导出目标)。读完本文,你将掌握从安装、抓取、AI 增强到打包、上传、安装进各类 Agent 的完整实战链路,并理解其背后基于SkillAdaptor抽象与统一调度器的源码实现原理。
1. 项目定位:一次准备,多处使用
Skill Seekers 的核心定位是"The data layer for AI systems"(AI 系统的数据层)。它并不直接提供模型,而是负责把人类可读的文档/代码/资料,加工成 AI 可以直接消费的结构化知识资产:
| 使用场景 | 输出物 | 服务对象 |
|---|---|---|
| AI Skills | 完整的SKILL.md+ 参考文件 | Claude Code、Gemini、GPT |
| RAG 管道 | 带丰富元数据的分块文档 | LangChain、LlamaIndex、Haystack |
| 向量数据库 | 可直接 upsert 的预格式化数据 | Pinecone、Chroma、Weaviate、FAISS、Qdrant |
| AI 编码助手 | IDE AI 自动读取的上下文文件 | Cursor、Windsurf、Cline、Continue.dev |
这一"一次准备、四处消费"的设计,意味着抓取和增强工作只需要做一遍,随后任意目标平台都可以直接复用,无需重新抓取。
2. 安装:按需选择 extras
项目要求Python 3.10+与 Git。基础安装极其简单:
pip install skill-seekers # 核心:抓取、GitHub、PDF、打包 pip install skill-seekers[all-llms] # + 所有 LLM 平台 pip install skill-seekers[mcp] # + MCP 服务器 pip install skill-seekers[all] # 全部如果拿不准需要哪些能力,可以直接运行配置向导:
skill-seekers-setup项目的安装 extras 采用"按需扩展"策略,下表来自 README.md 并对应仓库内的实现模块:
| 安装项 | 额外能力 |
|---|---|
skill-seekers[gemini] | Google Gemini 支持 |
skill-seekers[openai] | OpenAI ChatGPT 支持 |
skill-seekers[all-llms] | 全部 LLM 平台 |
skill-seekers[mcp] | 面向 Claude Code、Cursor 等的 MCP 服务器 |
skill-seekers[video] | YouTube/Vimeo 字幕与元数据提取 |
skill-seekers[video-full] | 额外包含 Whisper 转录与视觉帧提取 |
skill-seekers[jupyter] | Jupyter Notebook 支持 |
skill-seekers[pptx] | PowerPoint 支持 |
skill-seekers[confluence] | Confluence wiki 支持 |
skill-seekers[notion] | Notion 页面支持 |
skill-seekers[rss] | RSS/Atom feed 支持 |
skill-seekers[chat] | Slack/Discord 聊天导出支持 |
skill-seekers[asciidoc] | AsciiDoc 支持 |
skill-seekers[all] | 全部 |
提示:视频视觉依赖是 GPU 感知的。安装
skill-seekers[video-full]后,执行skill-seekers create --setup会自动检测 GPU 并安装匹配的 PyTorch 变体与 easyocr。
新手可先阅读 Bulletproof Quick Start 快速上手。
3. 快速开始:3 条命令产出第一个 Skill
Skill Seekers 的完整工作流只需三条命令:
# 1. 安装 pip install skill-seekers # 2. 从任意来源创建技能(自动检测来源类型) skill-seekers create https://docs.djangoproject.com/ # 可选:在不创建任何内容的前提下预览来源的检测结果 skill-seekers detect https://docs.djangoproject.com/ --json # 3. 为你的 AI 平台打包 skill-seekers package output/django --target claude执行完毕后,当前目录下会得到output/django-claude.zip,一个开箱即用的 Claude Skill。
默认 AI 增强代理是claude,也可以随时切换:
skill-seekers create https://docs.djangoproject.com/ --agent kimi skill-seekers create https://docs.djangoproject.com/ --agent-cmd "my-custom-agent run"其中--agent-cmd允许接入任意自定义 CLI 代理,为无法直接调用 API 的场景提供了灵活性。
3.1 源码视角:统一的命令分发入口
从源码看,所有命令都汇入同一个入口 src/skill_seekers/cli/main.py:create、detect、scan、doctor、ui采用类式分发(Command(args).execute()),其余命令(enhance、package、upload、install、estimate、quality、workflows、stream、update等)通过模块映射分发。这种统一分发表意味着每个子命令既可独立作为skill-seekers-<cmd>入口运行,也能共享主解析器参数。
4. 自动检测:detect与来源类型判断
skill-seekers detect <source> --json用于不落地任何产物地预览来源类型识别结果,非常适合脚本化调用或在 CI 中确认输入类型。
自动检测由 src/skill_seekers/cli/source_detector.py 中的SourceDetector类实现:它通过 GitHub 仓库名正则(owner/repo模式与github.com/...URL 模式)识别仓库来源,并结合 URL、扩展名与本地路径特征识别 web、local、PDF、config 等类型。值得注意的是,从源码注释可以看出,Confluence、Notion、Slack/Discord 聊天这类基于 API/导出的来源无法从单个参数自动推断,需要走各自专属的子命令(--space-key、--database-id、--chat-export-path等)。
5. 全部 18 种来源类型
Skill Seekers 的create命令对输入做统一检测,只需把不同类型的源直接当作参数传入:
skill-seekers create facebook/react # GitHub 仓库 skill-seekers create ./my-project # 本地代码库 skill-seekers create manual.pdf # PDF skill-seekers create report.docx # Word skill-seekers create book.epub # EPUB skill-seekers create notebook.ipynb # Jupyter skill-seekers create openapi.yaml # OpenAPI/Swagger skill-seekers create presentation.pptx # PowerPoint skill-seekers create guide.adoc # AsciiDoc skill-seekers create page.html # 本地 HTML(或整个目录) skill-seekers create feed.rss # RSS/Atom skill-seekers create curl.1 # Man page # 视频(YouTube、Vimeo 或本地文件——需要 skill-seekers[video]) skill-seekers create --video-url https://www.youtube.com/watch?v=... --name mytutorial skill-seekers create --setup # 自动安装 GPU 感知的视觉依赖 skill-seekers create --space-key TEAM --name wiki # Confluence skill-seekers create --database-id ... --name docs # Notion skill-seekers create --chat-export-path ./slack-export --name team-chat # Slack/Discord每种来源的详细参数见 Scraping Guide。
5.1 源码视角:统一调度的来源分派表
从 src/skill_seekers/cli/unified_scraper.py 的SOURCE_DISPATCH可以看到,多来源抓取是同一套调度逻辑:documentation、github、pdf、word、video、local、epub、jupyter、html、openapi、asciidoc、pptx、confluence、notion、rss、manpage、chat各映射到独立的_scrape_*处理函数,形成"一个统一入口、按类型分发"的架构。
6. AI 驱动的项目扫描:scan
scan命令面向已有代码项目:让一个 AI 代理读取项目的 manifests、README、Dockerfile/CI 以及采样源码导入语句,然后为检测到的每个框架各生成一份配置,外加一份针对你自己代码的<project>-codebase.json:
skill-seekers scan ./my-react-app --out ./configs/scanned/ # → react.json, vite.json, tailwind.json, jest.json, my-react-app-codebase.json skill-seekers create ./configs/scanned/react.json如果某个检测结果没有现成预设,AI 会现场生成全新配置;退出时还可选择将配置发布回社区注册表。仓库 configs/ 目录中已经存放了多份真实可用的配置示例(如 react.json、godot_unified.json、unity-spine.json 等),可直接作为skill-seekers create configs/xxx.json的输入。
7. 多来源统一配置:一份 config 抓取整个知识域
create也可以直接接收一份 JSON 配置文件,一次性聚合多个来源。以仓库内置的 configs/react.json 为例,它同时包含documentation(react.dev 官网,带 CSS 选择器、URL 排除规则、主题分类与限速)和github(facebook/react 源码仓库,开启代码库分析、issue 与 release 抓取)两类来源:
{ "name": "react", "description": "Complete React knowledge base combining official documentation and React codebase insights.", "version": "1.1.0", "merge_mode": "rule-based", "sources": [ { "type": "documentation", "base_url": "https://react.dev/", "extract_api": true, "selectors": { "main_content": "article", "title": "h1", "code_blocks": "pre code" }, "url_patterns": { "include": [], "exclude": ["/blog/", "/community/"] }, "categories": { "getting_started": ["learn", "installation", "quick-start"], "components": ["components", "props", "state"], "hooks": ["hooks", "usestate", "useeffect", "usecontext"], "api": ["api", "reference"], "advanced": ["context", "refs", "portals", "suspense"] }, "rate_limit": 0.5 }, { "type": "github", "repo": "facebook/react", "enable_codebase_analysis": true, "code_analysis_depth": "deep", "fetch_issues": true, "max_issues": 100, "fetch_changelog": true, "fetch_releases": true, "file_patterns": [ "packages/react/src/**/*.js", "packages/react-dom/src/**/*.js" ] } ], "base_url": "https://react.dev/" }merge_mode支持rule-based与ai-enhanced两种合并策略(后者对应源码中的AIEnhancedMerger,前者对应RuleBasedMerger,均位于 src/skill_seekers/cli/merge_sources.py)。多来源会先经过冲突检测器(conflict_detector.py)识别来源间的冲突,再进行跨来源配对合成。完整配置格式见 CONFIG_FORMAT.md,统一抓取细节见 UNIFIED_SCRAPING.md。
8. AI 增强:API 模式与 LOCAL 模式
所有 AI 调用都通过同一条传输通道完成,支持两种模式:
- API 模式:Anthropic、Google Gemini、OpenAI、Moonshot/Kimi、MiniMax,直接调用云端模型;
- LOCAL 模式:Claude Code、Kimi Code、Codex、Copilot、OpenCode 或自定义代理,无 API 费用。
增强深度由--enhance-level 0-3控制,代理选择由--agent指定。最终产出通常是500 行以上、包含示例、模式与指南的SKILL.md。
skill-seekers create ./my-project --preset quick # 1–2 分钟,浅层 skill-seekers create ./my-project --preset standard # 均衡(默认) skill-seekers create ./my-project --preset comprehensive # 深度、穷尽GitHub/代码库分析采用C3.x 三流架构:代码流(AST、设计模式、测试)、文档流(README、docs/、wiki)、社区流(issues、PRs、元数据),并内置跨 9 种语言的 10 个 GoF 模式检测器。相关深度文档:
- Enhancement Guide · Enhancement Modes · Multi-Agent Setup
- Pattern Detection · How-To Guides · Test Example Extraction
9. 打包导出:22 个目标平台
package负责把加工好的目录打包成各平台可识别的产物:
skill-seekers package output/react --target claude # → Claude Skill(ZIP + YAML) skill-seekers package output/react --target langchain # → LangChain Documents skill-seekers package output/react --target llama-index # → LlamaIndex TextNodes skill-seekers package output/react --target ibm-bob # → IBM Bob skill 目录完整目标分类如下:
- LLM 平台(12 个):
claude·gemini·openai·minimax·opencode·kimi·deepseek·qwen·openrouter·together·fireworks·markdown - RAG 与向量库(8 个):
langchain·llama-index·haystack·chroma·faiss·weaviate·qdrant·pinecone - 其他(2 个):
atlas·ibm-bob
各平台支持细节见 Feature Matrix。
9.1 源码视角:SkillAdaptor抽象基类
22 个目标之所以能共享同一套上游产物,是因为它们都实现同一个抽象接口 src/skill_seekers/cli/adaptors/base.py 中的SkillAdaptorABC:每个适配器负责平台特定的SKILL.md格式化、打包结构(ZIP、tar.gz 等)、上传端点与鉴权,以及可选的 AI 增强能力。仓库adaptors/目录下的 20+ 个文件(claude.py、gemini.py、openai.py、langchain.py、qdrant.py、weaviate.py等)即对应全部导出目标。抓取与增强只需一次,打包时按需选择适配器即可。
10. 技能内的搜索索引(可选)
skill-seekers create <source> --index会在生成的技能目录中加入仅依赖标准库的scripts/search.py,并基于生成的参考文件构建SQLite FTS5 全文索引。这样 Agent 在通读大型 Markdown 之前,可以先通过检索定位到正确的file#anchor,显著降低大文档场景的 token 开销。该功能默认关闭,且不会改动原始 Markdown 内容。详见 Skill Search Index。
11. MCP 集成:40 个工具,面向主流 IDE
Skill Seekers 自带 MCP 服务器,可接入 Claude Code、Cursor、Windsurf、VS Code + Cline、IntelliJ IDEA 等环境:
# stdio 模式(Claude Code、VS Code + Cline) python -m skill_seekers.mcp.server_fastmcp # HTTP 模式(Cursor、Windsurf、IntelliJ) python -m skill_seekers.mcp.server_fastmcp --transport http --port 8765启动后即可直接用自然语言驱动整个流水线,例如:"Package and upload the React skill."。从 src/skill_seekers/mcp/server_fastmcp.py 的模块说明可以看到,工具按功能划分为配置类(generate_config、list_configs、validate_config)、抓取类(scrape_docs、scrape_github、scrape_pdf、scrape_video等)、打包类(package_skill、upload_skill、enhance_skill、install_skill)、拆分类、来源管理类、市场类与向量库导出类。HTTP 传输的详细用法见 HTTP_TRANSPORT.md。
12. 安装到 19 个 AI 编码代理
生成的技能可一键安装进19 个 AI 编码代理:
skill-seekers install-agent output/react/ --agent cursor skill-seekers install-agent output/react/ --agent all # 安装到所有检测到的代理 skill-seekers install-agent output/react/ --agent cursor --dry-run安装位置与作用域对应关系如下(摘自 README.md):
| 代理 | 路径 | 作用域 |
|---|---|---|
| Claude Code | ~/.claude/skills/ | 全局 |
| Cursor | .cursor/skills/ | 项目 |
| VS Code / Copilot | .github/skills/ | 项目 |
| Amp | ~/.amp/skills/ | 全局 |
| Goose | ~/.config/goose/skills/ | 全局 |
| OpenCode | ~/.opencode/skills/ | 全局 |
| Letta | ~/.letta/skills/ | 全局 |
| Aide | ~/.aide/skills/ | 全局 |
| Windsurf | ~/.windsurf/skills/ | 全局 |
| Neovate | ~/.neovate/skills/ | 全局 |
| Roo Code | .roo/skills/ | 项目 |
| Cline | .cline/skills/ | 项目 |
| Aider | ~/.aider/skills/ | 全局 |
| Bolt | .bolt/skills/ | 项目 |
| Kilo Code | .kilo/skills/ | 项目 |
| Continue | ~/.continue/skills/ | 全局 |
| Kimi Code | ~/.kimi/skills/ | 全局 |
| IBM Bob | .bob/skills/ | 项目 |
12.1 上传到 Claude
export ANTHROPIC_API_KEY=sk-ant-... skill-seekers package output/react/ --upload # 打包并上传 skill-seekers upload output/react.zip # 上传已存在的 zip没有 API Key 时,也可以打包后手动把output/react.zip上传到 claude.ai/skills。完整流程见 Upload Guide。
13. 工作原理:五步流水线与 8 大核心模块
README 中给出了端到端流水线(Scrape → Categorize → Enhance → Package → Upload):
- Scrape——提取每个页面(优先检查
llms.txt); - Categorize——把内容组织成主题(API、指南、教程等);
- Enhance——AI 撰写带示例的完整
SKILL.md; - Package——打包为平台就绪产物;
- Upload——(可选)投递到你的 AI 平台。
架构上由8 个核心模块 + 5 个工具模块(约 200 个类)组成:
| 模块 | 职责 |
|---|---|
| CLICore | Git 风格命令分发器、来源自动检测 |
| Scrapers | 18 种来源类型的提取器,共享同一构建层 |
| Adaptors | 22 种输出平台格式,统一实现SkillAdaptorABC |
| Analysis | C3.x 代码库流水线、10 个 GoF 模式检测器 |
| Enhancement | 通过单一AgentClient传输通道完成 AI 增强 |
| Packaging | 打包、上传与安装技能 |
| MCP | FastMCP 服务器(40 个工具、10 个工具模块) |
| Sync | 文档变更检测与通知 |
深度内容见 UML Architecture(含 14 张 UML 图)、API Reference 与 Skill Architecture。
14. 质量、同步与规模
14.1 质量门槛
skill-seekers quality output/react/ --threshold 7 # 质量评分 + 门槛 skill-seekers quality output/react/ --json # JSON 输出,供 CI 使用同时提供面向英文的可读性指标(仅作参考,不影响最终分数)。详见 CODE_QUALITY.md。
14.2 文档变更同步与超大规模处理
sync-config用于检测配置漂移;- 支持文档变更检测、定时重抓取与通知;
- 对超大规模文档集(1 万–4 万+ 页)提供流式摄入(
stream)与增量更新(update),详见 Large Documentation。
14.3 性能参考(来自 README)
| 文档规模 | 耗时 | 输出体积 |
|---|---|---|
| 小(< 100 页) | 5–10 分钟 | ~2 MB |
| 中(100–500 页) | 15–30 分钟 | ~10 MB |
| 大(500–2,000 页) | 30–60 分钟 | ~40 MB |
| 超大(10K–40K+ 页) | 使用stream | 见 LARGE_DOCUMENTATION |
15. 故障排查
skill-seekers doctor # 诊断安装与环境 skill-seekers doctor --json # 机器可读诊断,供 CI 与 Agent 使用 skill-seekers sync-config # 检测配置漂移常见问题见 Troubleshooting Guide 与 TROUBLESHOOTING.md。
16. 小结
Skill Seekers 用一个统一的数据处理流水线,把"把文档变成 AI 技能"这件事从数天的人工整理压缩到十几分钟:来源自动检测 → 多源统一抓取 → 冲突检测与合并 → AI 增强 → 22 目标打包 → 一键安装/上传。其可扩展性来自两处源码设计:SkillAdaptor抽象(新平台只需新增一个适配器)与统一的命令/来源分派表(src/skill_seekers/cli/main.py、src/skill_seekers/cli/unified_scraper.py)。本文覆盖的完整命令索引见 CLI_REFERENCE.md,更多集成方案(LangChain、RAG Pipelines、Cursor、Windsurf、Cline)见 docs/integrations 目录。
- 人工智能
- AI 应用
- AI 技能
- RAG
- MCP 服务
- 网页爬虫
【免费下载链接】Skill_Seekers
Convert documentation websites, GitHub repositories, and PDFs into Claude AI skills with automatic conflict detection
相关推荐
Skill Seekers Skill Builder:用 MCP 工具链将文档、仓库与 PDF 自动转换为 AI Skill
Skill Seekers Skill Builder:用 MCP 工具链将文档、仓库与 PDF 自动转换为 AI Skill 本文围绕 Skill Seeke
人工智能AI 应用AI 技能RAGMCP 服务网页爬虫Skill Seekers 快速上手:3 步把文档网站与代码仓库转化为可直接使用的 AI 技能
Skill Seekers 快速上手:3 步把文档网站与代码仓库转化为可直接使用的 AI 技能 本文以仓库中的历史文档 QUICKSTART.md https:
人工智能AI 应用AI 技能RAGMCP 服务网页爬虫5大关键技术突破:HackRF射频开关如何重新定义软件无线电的灵活性边界
5大关键技术突破:HackRF射频开关如何重新定义软件无线电的灵活性边界 在当今无线通信技术飞速发展的时代,软件定义无线电(SDR)已成为研究和开发的重要工具。
人工智能AI 应用AI 技能RAGMCP 服务网页爬虫
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考