Nature Skills 文献检索实战:nature-academic-search 多源检索与严格他引审计
【免费下载链接】nature-skills符合nature论文学术表达和科研绘图的Skill项目地址: https://gitcode.com/gh_mirrors/na/nature-skills
做科研最耗时的环节之一,就是文献检索:在 PubMed、CrossRef、arXiv 之间反复切换,复制粘贴元数据,去重、核引文,再手动判断“谁才是真正引用过我论文的人”。Nature Skills 开源项目中的nature-academic-search技能,正是为了解决这些问题:它是一个面向 Nature 论文学术表达场景的多源学术文献检索与引用审计 Skill,一条自然语言指令即可完成跨库检索、去重排序、引文格式导出,乃至“严格他引”审计——自动排除自引和课题组内部引用,识别高影响力引用者。
一、nature-academic-search 能做什么
nature-academic-search位于技能目录 skills/nature-academic-search/,入口是 SKILL.md。它内置了 6 条标准工作流(workflow),覆盖从“找文献”到“审引用”的完整链路:
| 工作流 | 文件 | 典型场景 |
|---|---|---|
| 多源检索 | wf1-multi-source-search.md | 按主题并行检索多个数据库并去重排序 |
| 引文核对 | wf2-citation-verification.md | 校验稿件中参考文献字段是否正确 |
| MeSH 检索策略 | wf3-mesh-strategy.md | 为 PubMed 检索式补 MeSH 词和同义词 |
| 引文文件管理 | wf4-citation-file-mgmt.md | 转换.ris/.bib/.nbib等格式 |
| 参考文献管理 | wf5-reference-mgmt.md | BibTeX、相关论文发现、DOI/PMID 互转 |
| 严格他引审计 | wf6-strict-other-citation-impact-audit.md | 排除自引/团队引,识别“大牛”引用者 |
典型请求可以直接用自然语言发出,例如:“按这个主题找 20 篇近五年的 Nature/Science/Cell 相关论文”“帮我查这篇论文的严格他引,并列出高影响力引用者”。
二、一键安装:三步跑通
仓库提供npx skills、Claude Code、Codex 等多种安装方式,详见 README.md 的安装章节。以最通用的方式为例:
git clone https://gitcode.com/gh_mirrors/na/nature-skills cd nature-skills/skills/nature-academic-search bash install.sh安装后,把仓库地址发给 Codex 或 Claude Code,它会自动读取 SKILL.md 的路由协议,按需加载对应工作流,无需你手动指定脚本。
快速预检:批量网络操作前,可运行预检脚本验证 API 端点可达性(见 static/core/routing-and-ops.md):
python scripts/preflight.py三、多源检索实战:T1→T2→T3 分级路由
多源检索最大的坑是“数据源靠不靠谱”。nature-academic-search用一张分级表解决它(完整版见 references/source-tiers.md):
- T1(官方 API,结构化):PubMed、CrossRef、arXiv —— 优先使用;
- T2(API 有限):Semantic Scholar、bioRxiv、medRxiv —— T1 不够时升级;
- T3(爬虫/需机构权限):Google Scholar、Web of Science、Scopus —— 最后手段,并明确警告“结果可能不完整”。
多源检索(Workflow 1)的实际流程是:分析主题 → 按层级选源 → 并行调用检索工具 → 统一去重 → 排序 → 输出带来源标签的文献表。去重逻辑封装在 references/dedup-engine.md,检索式构造与结果排序规则在 references/search-strategy.md。
如果没有挂载 MCP 服务,技能还内置了免 MCP 降级方案:scripts/academic_search.py 直接调用 OpenAlex 公开接口完成发现式检索,scripts/format-converter.py 把选中的 DOI/PMID 导出为.ris/.bib/.enw/.nbib,仅依赖 Python 标准库:
python scripts/academic_search.py "graph neural network potentials" --limit 10 --sort cited_by_count python scripts/format-converter.py --doi 10.1103/physrevlett.120.143001 --format ris四、严格他引审计实战:找出“真正的大牛引用”
这是该技能最有含金量的部分(Workflow 6,规范见 wf6-strict-other-citation-impact-audit.md)。它的核心思路是:引用数高 ≠ 影响力高,必须剔除自引和课题组互引,剩下的“严格他引”才算数。
1️⃣ 五档分类标签—— 每篇引用文献都被保守标注:
| 标签 | 含义 |
|---|---|
confirmed_strict_other_citation | 严格他引:作者无重叠、无同团队/机构嫌疑 |
probable_external_citation | 疑似外部引用:元数据不完整 |
self_or_team_citation | 自引或同团队引用 |
collaborator_or_affiliation_overlap | 合作者/机构重叠,独立性存疑 |
unknown_metadata | 元数据不足,无法判定 |
2️⃣ 高影响力引用者识别—— 只在严格他引中筛查院士、杰青/长江学者、Fellow、院校领导等身份,且要求证据链:官方名录 > 学会 Fellow 名单 > ORCID/Scopus 档案 > 新闻报道。同名不同人直接标为unverified。
3️⃣ 引用语境与态度—— 提取引用句及其上下文,判断引用功能(方法使用、基准对比、直接延伸、批评……)和态度(正面/中性/批评),绝不因为“被引用了”就默认是赞美。
4️⃣ 文章级引用指标表—— 直接输出规范表格:
| 文章名 | 发表时间 | 作者名 | 作者机构 | 引用数 | 严格他引数 | DOI | 证据 / 备注 |
|---|
并强制附注“计数来源:引用数来源 / 严格他引判定来源 / 未覆盖的来源”,保证结果可追溯。
五、边界与常见误区 ⚠️
技能文档把红线写得很清楚(见 README.md 的“边界”一节):
- 不绕过权限墙:无 Scopus/CNKI 权限时不会“变通”,只会如实报告缺失来源;
- 不臆造字段:元数据缺失就标注缺失,绝不编造;
- 二级索引只作线索:关键字段要回到 DOI、PubMed 或出版社页面核实;
- 中文文献(CNKI/万方)不在 CrossRef/PubMed 覆盖范围,需手动补充。
六、与其他技能联动
nature-academic-search是 Nature Skills 科研流水线的第一环(见上图中 nature-academic-search → nature-reader → nature-citation 的接力顺序)。检索完成后,可以无缝衔接:
- nature-citation:为手稿 claim 匹配 Nature/CNS/Cell 支撑文献;
- nature-ref-verifier:逐条核查参考文献字段;
- nature-literature-pipeline:把一次性检索升级为持续文献监测。
七、小结
nature-academic-search把“文献检索 + 严格他引审计”这件琐碎且容易出错的事,封装成了分级路由的多源检索 + 五档他引分类 + 证据化报告的标准流程。对新手来说,你只需要提供主题、时间范围和排除口径,剩下的并行检索、去重、排序、审计表格都由技能自动完成——这正是 Nature Skills 让 AI Agent 参与科研的典型方式:流程标准化,结果可验证 📚
【免费下载链接】nature-skills符合nature论文学术表达和科研绘图的Skill项目地址: https://gitcode.com/gh_mirrors/na/nature-skills
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考