☰
染色体外环状DNA:肿瘤基因组的新前沿与检测策略
2026/10/4 1:23:53 网站建设 项目流程

两年多前,我处理一批胶质母细胞瘤的全基因组数据,遇到一例很反常的样本:EGFR位点的覆盖深度高得离谱,常规扩增分析却怎么都拼不回一条线性染色体上。后来我把那些断头读段的连接关系摊开,才意识到高拷贝片段并不是散落在基因组不同位置,而是首尾相接成环、游离在染色体之外——这就是染色体外环状DNA。

这几年,这个名词在肿瘤研究里升温非常快,已经从一个偏冷门的细胞遗传学观察,变成公认的肿瘤基因组新阵地。无论你是做肿瘤机制、生信分析、病理诊断,还是找治疗靶点,都应该花点时间把它彻底搞明白。这篇文章我会按我自己的实践理解,把几个核心问题讲清楚:它到底是什么,为什么在肿瘤里如此能折腾,怎么在实验和测序数据里把它找出来,以及眼下有哪些临床转化窗口。

1. 先说清楚:eccDNA、microDNA 和肿瘤里的 ecDNA 并不是同一个东西

很多刚接触这个方向的人,第一道坎不是技术,而是概念。中文文献里“染色体外环状DNA”经常被直接翻译成eccDNA,但eccDNA其实是个很大的筐,里面装着好几类性质完全不同的分子。如果不先把边界划清楚,后面读文献、搭算法、设计实验都很容易跑偏。

1.1 三种经常被混为一谈的环状DNA

我习惯把目前文献里常见的环状DNA分成三类,它们的生物起源、片段大小、功能意义都不一样。

第一类叫microDNA,通常只有几百个碱基到几千个碱基,不含完整基因,来源很随机,很多是从基因密集区域“剪”下来的小环。这类分子在正常细胞和肿瘤细胞里都存在,目前科学界对它的功能还没有统一结论。有的研究认为它可能与嵌合RNA生成有关,也可能只是DNA复制或修复过程中的副产物。

第二类是广义的eccDNA,可以看作所有染色体外环状DNA的总称,大小可以从几百碱基到几百万碱基不等。老一辈研究人员在电镜下看到的“small polydispersed circular DNA”也属于这个范畴。这类分子虽然名字带着“环”,但绝大多数不携带驱动癌基因,在肿瘤发生里的作用仍有争议。

第三类是真正让肿瘤研究圈兴奋的癌性ecDNA,也叫oncogenic ecDNA。它通常很大,几百kb到数Mb,携带完整的癌基因和调控元件,比如EGFR、MYC、MYCN、ERBB2、MDM2等。它不含着丝粒和端粒,所以有丝分裂时不会被均等分配,拷贝数在子代细胞里可以剧烈波动。存在这类ecDNA的肿瘤,往往异质性更高,耐药能力更强。

类型典型大小形态与来源在肿瘤研究中的角色
microDNA几百bp~几千bp小环状,基因密集区剪接而来功能仍不明确,可能参与嵌合RNA生成
广义eccDNA数百bp~数Mb所有染色体外环状DNA总称大部分是副产物,部分可能是调控信号
癌性ecDNA数百kb~数Mb大环状,携带癌基因与调控元件驱动癌基因扩增、瘤内异质性和耐药

放在一起看就明白了:如果一篇文章说的是“肿瘤样本里检测到大量eccDNA”,它可能只是在描述很多小环;但如果说的是“肿瘤依赖ecDNA维持癌基因高表达”,那基本是在描述第三类大分子。中文语境下这两者经常被混着用,读文献时一定要先看方法学部分到底检测的是哪个尺寸范围的环。

1.2 从双微体到ecDNA的认知跃迁

其实染色体外环状DNA并不是新发现。上世纪五六十年代,细胞遗传学家就曾在儿童肿瘤细胞里观察到一种奇怪的结构,两条小小的染色体样颗粒并排出现,因为形态像是多出来的微小染色体,所以取名叫双微体(double minutes)。在很长一段时间里,双微体只是细胞遗传学的一个观察现象,大家默认它是基因扩增的产物,但并没有认为它值得被单独研究。

真正的认知转变发生在2010年代中后期。随着全基因组测序、长读长测序和染色质构象捕获技术成熟,研究人员发现双微体在分子层面就是一类大环状ecDNA,而且它们不只是简单的高拷贝重复,而是带有完整启动子、增强子、绝缘子等调控元件的功能单元。2019年前后,几篇关键研究把ecDNA推到了聚光灯下:一项覆盖三千多例肿瘤样本的泛癌分析显示,超过三分之一的肿瘤可检出ecDNA,在胶质母细胞瘤、神经母细胞瘤、乳腺癌、食管癌、肺癌等癌种中比例更高;同时,ecDNA的存在与患者预后更差显著相关。

换句话说,过去半个世纪肿瘤细胞遗传学里那个不起眼的“双微体”,今天被重新理解为驱动肿瘤演化的一类重要基因组载体。这个认知升级,带来的是整个研究范式的变化。

2. 肿瘤为什么选择环状:形成机制与三个“生存优势”

如果你问一个做进化生物学的人,为什么肿瘤特别偏爱染色体外环状结构,答案其实很直接:因为环状基因组给肿瘤提供了线性基因组难以获得的灵活性和高表达效率。

2.1 主流的形成假说:chromothripsis不是唯一入口

关于ecDNA是怎么来的,目前还没有一个统一模型,但几个假说基本得到了主流认可。

最常见的机制是染色体碎裂(chromothripsis)。一条染色体在某个事件中被打成几十甚至上百个片段,本该由DNA修复系统重新拼回去,但如果这些片段在修复过程中选了错误的方向连接,就可能形成环状分子。如果环里恰好包括一个强启动子和一个癌基因,这个环就获得了竞争优势,随着细胞分裂不断扩增,最终成为肿瘤基因组里最显眼的结构。

另一条重要路径是断裂-融合-桥(breakage-fusion-bridge, BFB)循环。染色体末端端粒丢失后,两个断裂的染色体末端会发生融合,形成双着丝粒染色体。在有丝分裂时,这个异常的染色体被拉向两极,形成“桥”,桥再次断裂后会产生新的重排,其中一部分可能被环化。BFB循环在多种肿瘤里都能检测到特征性拷贝数模式,和ecDNA形成密切相关。

还有一类是附加体切除模型。基因组里的重复序列、转座子等区域在DNA复制或修复时可能被切除,形成小环,再通过多次重组逐渐变大,最终变成携带癌基因的大环。这个过程可能在正常细胞里也在发生,但只有那些给细胞带来生长优势的环才会被正向选择保留下来。

说白了,ecDNA的形成本身可能是随机错误,但携带癌基因、能提高细胞适应度的那些环,会被肿瘤像“抽卡”一样留下来。

2.2 环状结构给肿瘤带来的三个“超能力”

理解了形成机制,还得明白为什么肿瘤一旦拿到ecDNA,就相当于拿到了“外挂”。我总结了三个核心优势。

第一个是拷贝数快速演化。线性染色体上的基因扩增通常是串联重复,拷贝数变化幅度有限,而且需要经过较长世代的累积。但ecDNA不含着丝粒,在有丝分裂时没有定向分配机制,子细胞里拿到的ecDNA数量可以忽多忽少。也就是说,一个细胞从携带10个拷贝变成携带100个拷贝,可能只需要几代分裂。当治疗压力出现时,肿瘤可以通过迅速调整ecDNA拷贝数来适应环境。

第二个是超强的转录活性。多项表观基因组研究表明,ecDNA上的染色质比线性基因组区域更开放,ATAC-seq信号明显更高,说明它有更多活跃的调控元件被暴露出来。开放染色质带来的结果就是癌基因表达水平被推得非常高。同样是EGFR扩增,如果基因以线性串联形式存在,表达水平是一回事;如果以ecDNA环状形式存在,表达水平可以高出一个数量级,而且更容易被增强子激活。

第三个是“多基因打包”能力。一条线性染色体上相隔很远的基因不容易被同时高表达,但ecDNA可以把一个癌基因和它所需的增强子、其他共扩增基因打包在同一个环上,形成一个小型“表达模块”。这解释了为什么在许多肿瘤里,几个关键基因会以非常高的频率同时扩增——它们可能就在同一个ecDNA环上被一起带动了。

2.3 表观层面:增强子风暴和ecDNA hubs

除了拷贝数和转录活性,ecDNA还有一层更微妙的优势:它在细胞核里不是散乱漂浮的,而是倾向于聚集成一个个“聚集点”,术语叫ecDNA hubs。

这个现象很像增强子“扎堆开会”。在正常基因组里,增强子和启动子通过染色质环化机制靠近,协同调控基因表达。ecDNA因为有大量开放染色质和增强子序列,多个环状DNA会在细胞核里物理靠近,形成高密度的转录中心。结果就是癌基因获得了远超线性扩增的转录资源,细胞里仿佛刮起一场增强子风暴。

对于药物研发来说,这点特别重要。因为ecDNA上的基因表达依赖这些聚集增强子和表观调节因子,那么靶向表观遗传调控的药物——比如BET抑制剂、CDK7抑制剂——就可能对ecDNA阳性的肿瘤有偏好性杀伤作用。后面讲治疗时会再展开。

3. 抓环的完整链路:从细胞到序列,从序列到结构

很多实验室卡在同一个地方:知道ecDNA重要,但不知道该怎么可靠地检测和定量。这里没有一劳永逸的单一方案,最稳妥的策略是湿实验和干实验交叉验证。

3.1 显微镜下看到的环:FISH和超分辨

最直接证明ecDNA存在的方法,是荧光原位杂交(FISH)。针对已知的扩增基因,比如EGFR或MYC,设计DNA探针,在间期细胞核上做杂交。如果基因扩增在线性染色体上,你会看到信号集中在染色体的特定位置;如果存在ecDNA,信号会呈多个分散的小点,散布在细胞核各处。

这个判断看似简单,实际操作有几个细节。一是探针质量必须稳定,商业探针或自标记BAC探针都需要做对照验证;二是DAPI染色和探针信号要同时采集,避免把染色体近旁的信号误判成染色体外信号;三是最好用z轴层扫,因为ecDNA小点在二维图像里很容易被漏掉。超分辨显微镜能提供更清晰的环形结构证据,但通量低,适合做机制研究,不适合做常规筛查。

3.2 短读长WGS和结构预测算法:从覆盖峰到环状路径

如果要筛查全基因组范围内是否存在ecDNA,目前的主流抓手还是全基因组测序(WGS),深度至少30x,最好做到60x。全外显子测序(WES)虽然能看到拷贝数异常,但缺乏足够的断点信息,无法可靠地区分ecDNA和线性串联扩增。

我的常规分析链路是:

  1. 原始数据质控,去除接头和低质量碱基;
  2. 用BWA-MEM比对到参考基因组,标记重复;
  3. 做拷贝数分析,找出高倍扩增区域;
  4. 提取比对文件里的不一致读段和soft-clipped读段,识别结构变异断点;
  5. 把高拷贝区域和断点信息放到AmpliconArchitect(AA)这类算法里,构建扩增子结构模型;
  6. 用AmpliconClassifier等分类器判断结构类型,区分ecDNA、双微体、BFB和线性串联扩增。

流程里最关键也是最容易出错的一步在第5步。AA不是简单地把高拷贝区域圈出来,它会把覆盖度信号和断点连接组合成一张图,然后寻找能解释所有数据的路径;如果路径首尾相接,就会输出环形结构。这个算法依赖高质量的比对结果,低质量的FFPE测序数据会让断点噪声急剧上升,得到很多假阳性环状结构。

实际的bash处理中,比对这一步和常规WGS分析没有区别:

bwa mem -M -t 16 reference.fa sample_R1.fastq.gz sample_R2.fastq.gz > sample.sam samtools view -bS sample.sam > sample.bam samtools sort -@ 16 sample.bam -o sample.sorted.bam samtools index sample.sorted.bam

比对完成后,记得用Picard或GATK做MarkDuplicates,再进入后续的拷贝数和断点分析。AA官方仓库有完整的预处理脚本,具体命令以当时版本为准,但输入格式基本就是排序去重后的BAM文件。

3.3 长读长与Circle-Seq的互补价值

短读长WGS可以发现ecDNA存在的迹象,但它很难把复杂的环状结构从头到尾组装出来。如果某个ecDNA携带了大量重复序列或结构高度复杂,短读长数据往往拼出“疑似的环”,却看不见完整的“真实形状”。

长读长测序,比如PacBio HiFi和纳米孔超长测序,可以在单个读段内跨越更长的片段,把断点连接处的几百bp变成几十kb的连续证据,显著提升ecDNA结构重建的准确性。缺点依然是成本和DNA起始量要求高,对临床样本尤其不友好。

如果研究对象是microDNA或小分子eccDNA,Circle-Seq是更合适的路线。它的原理是先提取细胞或血浆中的DNA,用专门的线性DNA外切酶把线性DNA消化掉,只留下环状分子,再用滚环扩增(RCA)放大信号,最后做测序。这套方法灵敏度和特异性都不错,但它的富集窗口偏向几百bp到几十kb的小环,对几百kb的大ecDNA并不适配。

所以选择技术路线前,先问自己一句:我想找的到底是哪种环?如果是与癌基因扩增相关的大ecDNA,WGS+FISH是主线;如果是探索小环分子标志物,Circle-Seq更合适。

3.4 样本处理和比对质控的常见坑

这个方向最隐蔽的坑,往往不在分析里,而在样本处理阶段。

首先是FFPE样本问题。石蜡包埋组织里DNA交联严重、片段化明显,很多小ecDNA在提取过程中就断了。做回顾性临床队列分析时,如果样本来源是FFPE,检出的ecDNA频率会被系统性低估。能用新鲜冷冻样本就尽量用新鲜冷冻样本,如果必须用FFPE,要把提取方法改成更温和的方案,并且用多个技术平台交叉验证。

其次是环状DNA在常规提取中的“隐形丢失”。很多商业化DNA提取柱对小片段DNA回收率较低,Circle-Seq所用的外切酶消化步骤也容易把部分大环非特异降解。我建议在提取后用Agilent片段分析仪看一下DNA片段分布,如果小片段比例异常低,就要警惕环状DNA丢失。

第三是分析中的GC偏好和比对假象。高拷贝区域通常伴随覆盖度极度不均,如果比对质量不高,soft-clipped读段会产生大量虚假断点。我的习惯是同时在两个参考基因组版本上跑一遍,结果一致才下结论。

最后强调一句:生信预测的ecDNA,必须在湿实验里得到FISH或至少PCR验证。只靠算法输出就直接写“该肿瘤存在ecDNA”,在审稿阶段很难站住脚。这也是我踩过最大的一次坑,下节详细说。

4. 从实验室到病床:耐药、液体活检和靶向干预

ecDNA研究的转化价值,最终要落在临床问题上。目前最受关注的三个方向,分别是耐药机制、液体活检和治疗策略。

4.1 耐药不是简单的拷贝数升降,而是结构演化

很多靶向药物的耐药机制,最后都指向同一个结论:肿瘤在治疗压力下,会把原本有限的ecDNA拷贝数快速扩增,或者产生携带突变的新ecDNA,让对应的耐药克隆活下来。

比如EGFR突变型非小细胞肺癌,一代三代EGFR-TKI的耐药机制里,除了常见二次突变,还有一个重要原因是EGFR通过ecDNA形式高倍扩增,使药物浓度不足以完全抑制残余信号。BRAF抑制剂耐药中也观察到类似现象:肿瘤细胞通过动态调整ecDNA上的BRAF拷贝数来“试探”最佳耐药剂量。

这种动态调整能力,是线性扩增难以企及的。线性串联重复虽然也可以增加拷贝数,但增减需要经历大规模同源重组,速度慢、代价高。而ecDNA因为随机分配,群体里永远存在拷贝数不同的亚克隆,一旦药物压力出现,高拷贝克隆会被快速筛出来。所以在研究耐药时,只看静态拷贝数远远不够,还要看扩增子的结构是否以环状形式存在、是否有变化空间。

4.2 血浆中的环状DNA:一个还在早期阶段的检测窗口

肿瘤细胞凋亡、坏死或主动释放时,细胞里的DNA会进入外周血,形成循环肿瘤DNA(ctDNA)。传统ctDNA检测主要捕捉线性DNA片段,但如果肿瘤细胞里存在大量ecDNA,这些环状分子同样可能进入血浆。

已经有研究在肿瘤患者血浆中检测到肿瘤来源的环状DNA,并且发现它们的序列组成与肿瘤组织里的ecDNA一致。这意味着液体活检可能是未来追踪ecDNA演化的重要窗口。相比组织穿刺,血浆检测可以反复取样,能连续监测治疗过程中ecDNA拷贝数和结构的变化,理论上可以实现耐药预警。

但必须承认,这个方向还远未标准化。环状DNA在血浆里的浓度低、半衰期未知、富集方法不统一,目前没有成熟的临床检测产品。我做过的几个探索性项目里,血浆小环DNA的批次效应很明显,实验流程差一个小步骤,结果可能天差地别。如果你打算做这个方向,一定要先固定好采血管、保存时间、提取试剂和分析流程,再谈队列发现。

4.3 针对ecDNA的干预:直接切、诱导丢失、靶向表观

治疗层面的进展,目前主要分为几条路线。

一是直接靶向ecDNA分子本身。CRISPR-Cas9可以设计导向RNA,在ecDNA的特异序列上制造双链断裂,让环状分子线性化。因为ecDNA不含着丝粒,线性化后的片段会在细胞分裂中逐渐丢失,从而降低癌基因拷贝数。这个策略在细胞和小鼠模型里已有概念验证,但要走到临床还面临递送效率、脱靶、耐药等大量问题。

二是利用ecDNA对表观遗传抑制剂的脆弱性。前面提到,ecDNA上有大量开放染色质和增强子,转录高度依赖BET蛋白、CDK7等表观调节因子。因此BET抑制剂、CDK7抑制剂在ecDNA阳性肿瘤中表现出更明显的杀伤效果。这类药物不是直接清除ecDNA,而是关闭ecDNA上的超强转录机器,让肿瘤细胞“带环死掉”。

三是利用复制应激和DNA损伤反应。ecDNA的高拷贝扩增意味着它需要大量复制起始,这会给肿瘤细胞带来额外的复制压力。PARP抑制剂、ATR抑制剂、CHK1抑制剂等药物,可能通过打击这些复制压力机制,选择性地杀伤ecDNA阳性细胞。目前这些还属于临床前和早期临床探索,但逻辑上非常自洽。

四是和天然免疫结合。当细胞质里出现异常环状DNA时,cGAS-STING通路会被激活,引发先天免疫反应。理论上说,肿瘤细胞如果大量产生eccDNA并泄漏到细胞质中,应该更容易被免疫系统识别。但肿瘤通常存在多种逃逸机制,会主动抑制这条通路。如果能找到方法让ecDNA诱导的天然免疫信号重新释放,也许能提高免疫治疗的应答率。

5. 我眼中最值得深挖的方向,以及给新入场者的几句实话

每次讲完ecDNA的现状,总有人问我同一个问题:既然方向这么好,到底还有哪些空白可以切入?这里我梳理一下我理解中几个卡了多年的核心问题,以及如果现在组队进入这个方向,我会怎么做。

5.1 几个卡了很久的科学问题

第一个问题是,ecDNA在不同癌种里的“普遍性”到底有多大。泛癌数据显示超过三分之一的肿瘤存在ecDNA,但不同研究之间的检出率差异很大。原因可能是技术平台不同,也可能是样本处理和算法差异。至今没有一个大样本、多中心、统一流程的ecDNA流行病学调查。

第二个问题是,正常细胞里的eccDNA是如何一步步演变成携带癌基因的大ecDNA的。目前多数研究集中在已形成的ecDNA上,但从小环到大环的“过渡形态”很少被系统追踪。搞清楚这个演化过程,有可能找到干预ecDNA形成的上游靶点。

第三个问题是,ecDNA拷贝数的动态变化由什么调控。细胞如何决定是保留更多ecDNA还是丢掉它?这背后可能存在一套我们还没理解的调控机制,也许和DNA复制时机、染色体分离错误、DNA损伤修复状态都有关。如果找到这种调控的开关,就可能人为降低ecDNA的稳定性,让肿瘤自己丢掉癌基因。

第四个问题是,如何在临床应用里建立“ecDNA检测”的标准化。现在做FISH、WGS、Circle-Seq的实验室各自有自己的标准和判读规则,结果的一致性难以保证。想要进入临床分层或伴随诊断,必须有统一的报告框架、阳性阈值和验证流程。

5.2 如果我现在进入这个方向,会怎么安排优先级

先说一句可能让很多人意外的话:不要一开始就上大队列、全基因组、高成本生信分析。我见过不止一个团队在公共数据里跑出一堆“预测ecDNA”的扩增子,最后因为缺乏湿实验验证,整个故事推倒重来。

如果让我重新排优先级,会是这样:

第一,先选定一个明确携带已知扩增子的肿瘤类型和细胞系模型,比如EGFR扩增的胶质母细胞瘤、MYCN扩增的神经母细胞瘤。用DNA FISH在几种候选细胞系里做预筛,确认哪一个在体外稳定携带ecDNA。

第二,用WGS(30x以上)和AmpliconArchitect把细胞系的ecDNA结构解析清楚,建立一套“FISH + WGS + 结构分类”的标准流程。这套流程以后所有项目都要复用,先跑通它,比急着出结果更值钱。

第三,用公共WGS数据,比如PCAWG等开放数据集做泛癌筛查,把算法跑出来的候选ecDNA都汇总起来,形成自己的数据库。公共数据的好处是可以无限次重复分析,不用花一分钱实验经费,适合团队早期积累分析经验。

第四,找到一两个具体的生物学问题,比如ecDNA在某一类耐药模型里的动态变化,设计纵向实验。这个阶段再决定要不要上长读长测序、单细胞测序或表观组学。

第五,如果目标是临床转化,从一开始就要收集新鲜冷冻肿瘤组织和配对血浆,处理好伦理和存储,确保后续能做液体活检探索。

总的来说,染色体外环状DNA这个方向的“风口”属性很明显,但真正能留下价值的工作,仍然是那些把机制讲清楚、把检测做扎实、把临床问题对齐的研究。技术本身会迭代,但“结构预测必须验证”这条底线,会一直适用。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询