☰
arXiv引用全攻略:从ID规则到BibTeX、APA、Chicago、IEEE格式避坑指南
2026/9/25 3:52:20 网站建设 项目流程

在学术圈里泡久了,你一定会发现 arXiv 的分量远超“预印本仓库”这几个字。物理、计算机、数学、统计这些领域的核心结果,经常是第一版完整内容直接挂在 arXiv 上,期刊论文反而是后来的“整理版”。我平时写论文、审稿、带学生,几乎每天都在跟 arXiv 打交道,说句实话,引用 arXiv 这件事的翻车率比我预想的高得多:版本号写没写、journal 字段填什么、已发表的论文要不要保留 arXiv 链接,这些细节我在审稿意见里见过太多次。这篇就集中把这些坑填平,从 ID 规则到 BibTeX、APA、Chicago、IEEE 的写法,再到什么场景该引什么版本,一次说透。新手可以按顺序读,老手直接跳到自己关心的章节。

1. 为什么arXiv引用是个容易翻车的事

1.1 先说清楚:arXiv到底是个什么所在

arXiv 是 1991 年由物理学家 Paul Ginsparg 建立的一个学术预印本平台,最初叫 "xxx.lanl.gov",后来才搬到康奈尔大学运营,现在由 arXiv.org 这个域名对外提供服务。它的核心逻辑很简单:研究者把尚未正式发表的论文稿子免费上传,全世界的同行第一时间就能看到,不用等长达数月甚至数年的期刊审稿周期。在粒子物理、天体物理、凝聚态物理、数学、计算机科学、统计学等学科里,arXiv 几乎成了事实上的“首发阵地”——很多重要结果的第一版完整内容就直接挂在 arXiv 上,期刊论文反而更像事后归档的形式版本。

我见过不少刚入学的博士生问:既然 arXiv 上的论文可以免费下载,那我在毕业论文里大量引用它是不是就行?答案是:可以引用,但不能无脑引用。引用 arXiv 意味着你引用的内容是未经同行评议的预印本,虽然其中很多论文后来都发表在顶级期刊或会议上,但“后来发表”不等于“已经发表”。严谨的审稿人会特别留意参考文献里有没有过度依赖 arXiv 的情况,因为预印本的内容可能还在修订,也缺少可追溯的版本记录。但反过来,如果某篇重要论文只有 arXiv 版本而没正式发表,你完全不引用它,同行又可能觉得你检索文献不到位。这个平衡就是本文要解决的核心问题。

1.2 引用arXiv与正式出版物的核心差别

为什么 arXiv 引用如此容易翻车?根源在于它和正式出版物的可引用性天生不对等。我总结成一张对比表,你一看就明白差别在哪:

维度正式发表论文(期刊/会议)arXiv 预印本
同行评议已经过审稿流程未经过审稿或仅部分是本人最终版
内容稳定性版面定稿后基本不变可以无限次提交新版本(v1、v2、v3……)
唯一标识DOI、期刊卷期页码arXiv ID(如 2401.12345v3)
检索收录Web of Science、Scopus 等Google Scholar 会抓取,但非正式索引
性质定位面向学术共同体的正式记录面向开放共享的预印本交流
引用惯例引用卷期页引用 arXiv 编号+版本号+链接

最关键的两点:一是同行评议状态不同,二是版本可变。正式论文一旦排版定稿,内容和页码就不会再变,你可以放心地引用“某卷某页”。但 arXiv 论文今天挂个 v1,明天作者改了内容挂个 v3,你若不写清版本号,读者点开链接看到的就可能和你引用的内容对不上。特别是做复现实验时,版本不一致会导致实验方法都对不上,论文被拒一点都不冤。我在审稿时就遇到过作者引用了一篇 arXiv 论文的旧版本定理编号,结果那个定理在新版本里已经被修正了,这种硬伤讨论起来非常尴尬。

2. 动手之前必须搞懂的:arXiv ID与版本规则

2.1 2015年之后的新式ID格式

arXiv 的编号系统经历过几次变化,而现在绝大多数论文用的是 2015 年以后的新格式。格式是:arXiv 加冒号,然后两位年份、两位月份、一个点、四位流水号,形如arXiv:2401.12345。比如 arXiv:2401.12345 就代表 2024 年 1 月提交的第 12345 篇论文。月份用 01~12 表示,论文编号从 00001 开始按提交顺序递增。注意这个流水号并不代表论文质量排序,纯粹是提交的先后顺序,不要因为编号靠后或靠前产生任何联想。

为什么要懂 ID 格式?因为你在 BibTeX 的 eprint 字段、在论文参考文献里的写法、以及在各类文献管理工具里搜索论文时,用的都是这个 ID。很多人直接把 arXiv 网址一长串复制到参考文献里,这是最常见的偷懒方式,审稿人看到只会皱眉。正确做法是写 “arXiv:2401.12345” 这种标准化形式,既简洁又规范。新式 ID 相对好办,因为格式统一,从 2015 年 1 月至今的论文都是这种YYMM.NNNNN结构。你在 Google Scholar、Semantic Scholar 或其他学术搜索引擎里看到的 arXiv 链接,对应 ID 往往可以直接按这个规律拆出来。

2.2 2007~2014与更早的老式ID格式

新式 ID 之前还有一个过渡期格式,2007 年至 2014 年的论文为arXiv:0706.1234这种结构——年份(两位)+ 月份(两位)+ 点号 + 四位编号,月份与编号之间没有年份和月份的分隔混排。举个例子,arXiv:0706.1234 就是 2007 年 6 月的第 1234 篇。和老式格式相比,它已经有了YYMM.NNNN的雏形,但没有扩展到五位数编号。

再往前追溯到 2007 年以前,格式就更加五花八门:早期是主题分类加编号,比如arXiv:math/0501234表示数学分类下 2005 年的第 1234 篇,还有像arXiv:astro-ph/0412301这种带学科缩写前缀的形式。到 2007 年之前,这类带分类前缀的 ID 很常见,像 hep-th(高能理论)、quant-ph(量子物理)、cs(计算机科学)都是那个时期的高频前缀。如果你要引用 2007 年以前的论文,建议直接去 arXiv 页面复制官方给出的 ID,不要自己脑补格式化规则,免得拼错。

老式论文在学术价值上并没有过时,很多经典工作就藏在里面。但引用时要在参考文献里写清完整的 arXiv ID,不要省略分类前缀,也不要把老式 ID 套进新式格式里。我在写综述时就遇到过想引用一篇 2004 年的经典数学论文,结果一开始直接把它当新式 ID 处理,写成了 arXiv:0405.1234 的样子,查了半天才发现真实编号是 math/0405123,白白浪费了几十分钟。这种事情出现一次你就会长记性。

2.3 v1、v2、v3版本号到底怎么理解

arXiv 论文每次提交或修改都会生成新的版本号。第一版叫 v1,作者根据反馈修改后重新提交叫 v2,以此类推。版本号和 ID 是组合在一起的,完整标识形如arXiv:2401.12345v3。问题在于:很多人引用时完全忽略版本号,而就 arXiv 平台的规则来说,链接 arxiv.org/abs/2401.12345 默认会跳到当前最新版,但如果你在参考文献里只写 arXiv:2401.12345,读者在几个月后点击链接,看到的可能是修改后的 v5,你的引用就可能对不上内容。

实际操作中我的建议分三种情况:第一,如果论文还在持续更新,你引用的是当前看到的版本,那么请把 v 字母和版本号写进参考文献,如 arXiv:2401.12345v3,让读者能精确找到你引用的内容。第二,如果论文已经稳定且你引用的是最新的正式版本,只写 arXiv:2401.12345 不带版本号也是可以接受的,因为平台会自动重定向到最新版。第三,如果你引用的预印本后来正式发表了,那根本不应该继续用 arXiv 引用作为主条目,而应该引正式出版物再加 DOI,这个问题我们第四章详细说。版本号怎么处理,直接影响读者能否复现你的引用,绝不能随手糊弄。

3. 不同引用风格下的arXiv参考文献写法

3.1 BibTeX条目:LaTeX用户的标配操作

在物理、数学、计算机领域写作,LaTeX 是绝对的主流,参考文献几乎全靠 BibTeX 或 BibLaTeX 管理。一个规范的 arXiv BibTeX 条目通常长这样:

@misc{liu2024deep, author = {Liu, Yiming and Wang, Xiaohua}, title = {Deep Learning for Physics: A Tutorial}, howpublished = {arXiv preprint}, year = {2024}, month = {1}, eprint = {2401.12345}, archivePrefix= {arXiv}, primaryClass = {physics.comp-ph}, url = {https://arxiv.org/abs/2401.12345v2} }

这里的核心字段说明一下:@misc是预印本的常用条目类型,因为预印本不属于正式期刊文章,用@article不合适;eprint字段存 arXiv 编号,注意不要带 arXiv 前缀,只写数字 ID;archivePrefix和primaryClass用来标记归档平台和主分类,部分模板会让这两项自动渲染成 “arXiv:2401.12345 [physics.comp-ph]” 的格式。url字段放论文摘要页链接即可,不要直接放 PDF 的下载链接,因为 PDF 地址不够稳定,而摘要页是永久地址。

从 arXiv 页面导出 BibTeX 时,平台自己生成的条目里journal字段通常会填成 “arXiv preprint arXiv:2401.12345”,这在实际提交给期刊时可能被编辑嫌弃,因为很多期刊模板要求 arXiv 预印本统一用@misc加eprint的组合。我的习惯是从 arXiv 导出后顺手检查一遍,把@article改回@misc,把journal字段替换成howpublished = {arXiv preprint},把eprint确认无误,这样编出来的参考文献表既专业又不出错。

3.2 主流写作风格示例:APA、Chicago、IEEE

不是所有学科都用 LaTeX,人文社科和管理学领域更常用 APA,工程和计算机会议论文则用 IEEE 风格。我们直接看 arXiv 论文在这些风格里的写法差异。

APA 第七版格式:

Liu, Y., & Wang, X. (2024). Deep learning for physics: A tutorial. arXiv. https://arxiv.org/abs/2401.12345

如果是正式发表版本,应当标注 DOI,arXiv 链接可以放在 “arXiv” 后面作为补充识别。

Chicago(作者-日期)风格:

Liu, Yiming, and Xiaohua Wang. 2024. "Deep Learning for Physics: A Tutorial." arXiv preprint. https://arxiv.org/abs/2401.12345.

Chicago(注释-参考文献)风格里,arXiv 编号通常写作 “arXiv:2401.12345”,版本号也可以按需加入。

IEEE 风格:

Y. Liu and X. Wang, "Deep learning for physics: A tutorial," arXiv preprint arXiv:2401.12345, Jan. 2024.

APA 和 Chicago 都把 arXiv 当成一个在线平台来处理,所以要有访问日期或链接,IEEE 则更在意期刊名和编号。说到底,每种风格都有自己的“前提假设”,只要顺着该风格的规则去填,就不会出大错。最怕的是从某个文献管理工具里导出的格式半中半西,一会带 DOI 一会只带 arXiv 链接,审稿人一看就知道你是批量生成后没检查。

3.3 各学科的习惯差异,别让格式拖了后腿

引用 arXiv 还有个容易忽略的问题:不同学科对预印本引用的接受度完全不同。在粒子物理和天体物理,引用 arXiv 几乎是家常便饭,很多经典结果只有 arXiv 版本,正式期刊反而跟在后面;审稿人不会因为你引用了 arXiv 而挑刺。在计算机科学里,预印本被广泛接受,但顶会论文在 camera-ready 版本里一般会把已发表的论文换成正式会议版本,并附上 DOI 或会议链接。在数学领域,arXiv 引用同样普遍,但很多期刊编辑要求作者在论文正式出版后把预印本条目从参考文献里替换掉。

所以我的建议是:开写论文前先看目标期刊或会议的作者指南(author guidelines),里面通常对预印本引用有明文规定。比如有些期刊明确要求 “已被接收的论文不得再作为预印本引用”,有的则说 “可以同时给出 arXiv 编号和正式发表信息”。与其到时候被审稿人打回修改,不如一步到位,按目标刊物的规则来。如果你的领域没有明文规定,那就参考该领域近两年同类型论文的参考文献表,看看主流作者是怎么处理 arXiv 引用记录的,照着做基本不会错。

4. 什么时候该引arXiv而不是正式出版物

4.1 预印本阶段的引用策略

最简单的情况是:你想引用的论文根本没有正式发表,只在 arXiv 上挂着,那除了引用 arXiv ID 没有别的选择。这在快速发展的研究方向上特别常见,比如大模型、量子计算、新算法架构,这些领域从产出结果到期刊发表往往滞后一两年,而 arXiv 上的结果可能已经迭代了好几版。在这种情况下,引用 arXiv 预印本是学术规范允许的,关键是标明版本状态,避免把预印本说的和正式发表一样肯定。

实际操作中我通常这样标注:如果是正文写作时参考了某个预印本,参考文献条目就写完整 ID 和链接;如果该预印本已被会议或期刊接收但还没正式出版,我会在正文里写 “已被 XXX 会议接收” 或 “已投稿至 XXX”,审稿人看到这个状态信息会更放心。许多会议的 camera-ready 版本允许作者引用自己的已被接收论文,哪怕现在显示的还是 arXiv 预印本,只要你标注清楚接收状态,这是严谨而非缺陷。

4.2 已正式发表:先查DOI再动手

另一种高频场景是:你无意中引用的 arXiv 论文其实早就正式发表了。比如你从 Google Scholar 搜索时看到了 arXiv 的预印本链接,顺手就拖进了参考文献,但后来发现这篇论文已经在 Nature、Physical Review Letters 或者 IEEE TPAMI 上正式刊出。这种情况下正确的做法只有一条:优先引用正式发表版本,并标注 DOI。正式版本有卷期页码和 DOI,可追溯性更强,内容在同行评议后更可靠,任何审稿人看到你放着正式版本不引用反而去引用预印本,都会觉得你的文献检索能力不过关。

要不要把 arXiv 链接同时保留?这要分两种情况。如果期刊允许在参考文献中同时列出正式版和预印本,通常建议在主条目写正式版,后面附加 “arXiv:XXXX.XXXXX” 的预印本标识。如果期刊格式有严格限制,只允许列一种条目,那果断选正式版。很多投稿系统还会在最终排版时自动把参考文献里的 arXiv 链接解析成正式出版信息,说明编辑部对预印本引用的态度是“有正式版就用正式版,没正式版才用预印本”。

4.3 一些只说没写的学科潜规则

我在各个领域投稿的经验告诉我,除了官方规定之外,“潜规则”也同样重要。在凝聚态物理和量子信息方向的很多顶刊审稿人看来,参考文献如果大量堆砌 arXiv 链接会被认为文献调研不扎实,因为这些领域有大量高质量论文发表在 PRL、PRA、Nature 子刊上;但在某些计算机视觉会议上,近两年的 SOTA 结果就是只有 arXiv 版本,审稿人反而知道你引用的预印本是最新进展,不会苛责。数学方向则比较特别,同行更习惯引用正式版本,因为数学论文一旦在期刊上定稿,证明内容通常不会再变动。

所以你真的需要在写作前研究一下目标期刊近两年的引用习惯。不要拿 CS 的习惯去套物理期刊,也不要拿数学的严谨去套工程类会议。做这个调查很简单:下载目标期刊最近一期三到五篇和你主题接近的论文,逐条看它们的参考文献表,凡是 arXiv 条目都看一下是怎么写的——是只写编号,还是编号加版本号,还是编号加正式版 DOI,一学就会。

5. 实战中容易踩的坑与排查办法

5.1 版本号漂移:你以为引的是最新版,其实不是

版本号这个坑我在给好几个研究组做论文修改时反复提到,这里专门讲透。典型的场景是:你在写论文时引用了某篇 arXiv 论文的 v1 或者 v2,文中写死了某个定理的编号和证明细节。三个月后审稿意见回来,你发现那篇论文已经出了 v4,定理编号变了,证明也改进了,你引用里的描述和最新版对不上,审稿人提醒你参考文献与正文内容不一致。

解决办法很简单:提交前把正文引用的每一条 arXiv 链接都点开检查一遍当前版本号,确保你引用的版本就是你实际使用的版本。如果想引用某个固定版本,请在参考文献里带上vX后缀;如果不想被版本变化干扰,就在正文里少写“该工作的具体定理编号”,用相对抽象的描述代替,比如“该方向的最新进展表明……[引用]”。这个技巧在写综述时尤其重要,因为综述往往要引用几十篇 arXiv 预印本,你用固定版本号才扛得住时间检验。

5.2 arXiv元数据的小陷阱

arXiv 的元数据并不总是和论文本身完全一致。常见的问题包括:作者列表只写了 arXiv 提交时的名单,正式发表时会增减作者;标题在 arXiv 上可能用了简写,正式版用了全称;作者姓名的拼写顺序可能调整。还有一个非常实用的细节:arXiv 平台上展示的学科分类(primaryClass)不一定准确,因为提交者是自行选择的分类,跨学科论文的归类往往凭个人判断。引用时如果不放心,可以在正文里引用 arXiv 编号,但论文的标题、作者、年份这些信息以你实际阅读的 PDF 版本为准。

遇到重名论文时要特别警惕。我曾见过两篇标题几乎一样的 arXiv 论文,编号只差一位数字,年份相差一年,一不留神引用了错误的那篇。所以每次引用之前养成好习惯:对照 arXiv 页面的标题、作者、摘要和你的引用条目逐项核对。不要只用 Google Scholar 的自动生成引用,那个经常把 arXiv 的预印本链接和正式版信息混在一起,我见过它把同一篇文章同时挂上 DOI 和 arXiv 编号,看着完整其实两者指向不同内容。

5.3 链接与永久标识符的正确用法

写参考文献时,arXiv 链接有两种常见错误写法。第一种是直接写 PDF 地址,比如https://arxiv.org/pdf/2401.12345v2——问题在于每次新版本发布后旧 PDF 链接虽然还能访问,但很多读者习惯性把它改成最新版,导致引用的内容漂移;而且 PDF 入参考文献太丑,期刊编辑常会要求改成摘要页地址。第二种是把链接写成https://arxiv.org/abs/2401.12345v2,这没问题,但别忘了在 ID 和链接之间维持一致:你用arXiv:2401.12345v2就要用abs/2401.12345v2,不要写着 v2 的编号却放着不带版本号的链接。

正确的规范写法应该这样:参考文献条目里使用摘要页永久链接https://arxiv.org/abs/2401.12345,如果确实需要锁定版本,就写https://arxiv.org/abs/2401.12345v2,并且正文和参考文献里的 arXiv ID 保持一致。还有一个很少人提的细节:arXiv 也为每篇论文分配了内部的 DOI(如 10.48550/arXiv.2401.12345),官方建议在正式引用中优先使用这个 DOI,因为它对预印本来说是永久标识。具体的 DOI 格式可以在 arXiv 论文页面的 “DOI” 字段看到,复制到 BibTeX 里的 doi 字段即可。

5.4 上手前的5项快速自查

引用 arXiv 论文时,我给自己定了五条硬性检查项,每次提交前逐条过一遍,分享给各位参考:

检查项判断标准
ID 格式是否正确新式 ID 为 YYMM.NNNNN,确认没有拼错或多打少打前导零
版本号是否锁定如果正文依赖具体版本,必须写 vX;如果不依赖,可不写
是否已有正式版去 Google Scholar 或 DOI 搜索确认,有正式版就优先引正式版
元数据是否一致标题、作者、年份与 arXiv 页面核对一致
链接是否指向摘要页确保链接为 abs/ 开头而不是 pdf/ 开头

这五条做下来,引用报错的概率至少能降九成。尤其是第二条“版本号是否锁定”,我见过太多因为版本漂移导致的引用事故,且这类错误极其隐蔽,往往要等审稿人指出来才意识到问题。养成提交前自查的习惯,比事后一阵翻改要轻松得多。

6. LaTeX实操:把arXiv文献管理得明明白白

6.1 从arXiv页面直接导出BibTeX

最简单的方式当然是让 arXiv 平台帮你生成条目。打开论文的摘要页,找到页面右侧的 “Export Citation” 下拉菜单,里面提供了 BibTeX、EndNote、RefWorks 和 NLM 几种格式。选择 BibTeX 后会弹出一段代码,直接复制进你的.bib文件就行。这是最快最省力的方法,特别适合一次性引用个位数论文的场景。

不过自动生成的条目有两个值得注意的地方:第一,它默认使用@article类型,写的是journal = {arXiv preprint arXiv:2401.12345},这在你的期刊模板里可能和编辑部要求的写法不一致;第二,它不会自动帮你关联正式发表的 DOI 信息,如果该论文在正式期刊上也发表了,你还是得手动去补 DOI。所以我的处理流程是:先用 Export Citation 快速获取基础信息,再按目标期刊或会议的格式要求微调,像加 @misc、改 howpublished、补 DOI,都是几分钟的事,但对投稿流畅度影响很大。

6.2 手动编写BibTeX条目的正确姿势

有时候自动导出不理想,或者你希望更精细地控制字段,那就手动写。手动编写 BibTeX 的关键是字段不乱放。我推荐下面这套规范写法:

@misc{lastname2024keyword, author = {Lastname, Firstname and Author2, Name2 and Author3, Name3}, title = {Full Title of the Paper}, howpublished = {arXiv preprint}, year = {2024}, month = {1}, note = {arXiv:2401.12345v2}, eprint = {2401.12345}, archivePrefix = {arXiv}, primaryClass = {cs.LG}, url = {https://arxiv.org/abs/2401.12345v2}, doi = {10.48550/arXiv.2401.12345} }

这个模板里做对了几件小事:一是用@misc而不是@article,语义更准确;二是同时保留eprint+archivePrefix组合和显式的url,满足不同期刊模板的渲染需求;三是doi字段补上了 arXiv 官方分配的 DOI,让条目有更强可检索性;四是note字段里清楚地再次写入 arXiv 编号和版本,视觉效果上更直接。如果你担心@misc在某些模板里渲染效果不佳,也可以用@article但把journal换成语义更准的“arXiv preprint”,这点完全看投稿要求,没有绝对对错。

6.3 用工具批量补全和去重

写综述或大论文时动辄引用几十上百篇 arXiv 论文,手动一个个建条目效率太低,这时就该上工具。比较常见的方案有两个:第一个是 Zotero——它的浏览器插件能一键保存 arXiv 页面信息,自动生成文件夹条目,之后再同步到 BibTeX;第二个是 Better BibTeX——这是 Zotero 的强力插件,能自动生成固定格式的 citation key,批量导出和更新 BibTeX 条目都极其方便。如果你喜欢用 EndNote 或 Mendeley,也可以直接从 arXiv 页面导出 EndNote 格式,再用文献管理器内置的导入功能。

用工具批量处理后,最容易遗漏的就是去重和字段检查。同一个工作可能在 arXiv 上有预印本版本,又在期刊或会议上发表了正式版,你的文献管理器里可能同时存在两个条目,引用编号还不一样,最后排版出来的参考文献表会同时列出“预印本”和“正式版”两条,既冗长又不规范。我处理这个问题的办法是:在写稿前先建一个 “参考文献清理” 的临时步骤,把所有条目按标题排序,人眼扫一遍找重复项,然后删除预印本条目、保留正式版条目,或者把正式版信息合并进预印本条目里。这种细致活很耗时间,但一劳永逸,后面就不会在参考文献表上出乱子。

最后再分享一个我从实际教训里总结出的小技巧:每篇论文投稿前,专门花十分钟检查所有 arXiv 引用条目的版本一致性。方法是下载一份论文正文,用正则表达式或直接搜索arXiv:关键字,把所有出现 arXiv 编号的地方列出来,然后逐一对照参考文献表。这样做一次之后你就会发现,漏写版本号、ID 拼写错误、链接和 ID 不匹配这类问题根本逃不过你的眼睛。这些小细节看着不起眼,却常常是编辑和审稿人最先注意到的地方——参考文献的整洁程度,某种程度上就是作者严谨度的第一张名片。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询