☰
Illumina测序从建库到数据分析全流程:SBS原理、文库构建与下机数据质控实战
2026/9/29 19:36:05 网站建设 项目流程

测序仪下机的原始数据,本质上就是一堆被荧光信号记录下来的图像文件。很多人第一次接触Illumina平台时,会以为"边合成边测序"(Sequencing By Synthesis,SBS)就是把DNA塞进去、等几个小时、然后拿到序列——中间发生了什么,完全是个黑盒。但真正做过文库构建、跑过测序、处理过下机数据的人都知道,从提取核酸到最终拿到可解释的变异结果,中间每一步都有明确的化学逻辑和工程约束,任何一个环节的参数跑偏,都会在最终数据里留下可识别的"指纹"。

这篇内容面向三类人:一是刚进实验室、需要独立完成从建库到数据分析全流程的研究生;二是做临床检测或农业育种、需要理解数据质量来源的技术人员;三是做生物信息分析、但想搞清楚"为什么这批数据质量差"的分析人员。我会把SBS的化学原理、文库构建的关键决策点、测序过程中的信号采集逻辑、以及下机数据的分析链路完整拆开讲,重点放在那些操作手册上不会写、但实际跑样本时一定会遇到的问题上。

1. 为什么SBS能成为主流:从化学逻辑到工程约束

1.1 可逆终止子:SBS的核心化学机制

Illumina的SBS技术之所以能统治高通量测序市场这么多年,根本原因在于它解决了一个核心矛盾:如何在一次反应中只延长一个碱基,并且准确识别是哪个碱基。

传统Sanger测序用的是双脱氧核苷酸(ddNTP),一旦掺入就终止延伸,所以每个反应管里只能得到一系列长度不同的片段。SBS的思路完全不同——它用的是可逆终止子(reversible terminator)。每个dNTP的3'端带有一个可化学切除的阻断基团,同时碱基上连有荧光标记。测序时,DNA聚合酶掺入一个带荧光和阻断基团的核苷酸后,延伸反应暂停;洗掉游离核苷酸,拍照记录荧光颜色;然后加入化学试剂切除阻断基团和荧光基团,恢复3'端羟基,进行下一轮掺入。

这个循环的设计非常精巧。荧光基团和阻断基团必须同时存在、同时去除,否则要么延伸失控,要么信号无法读取。实际运行中,切除效率不可能达到100%,总有一小部分链没有成功切除阻断基团,这些链在后续循环中就不再延伸,形成"信号衰减"。这就是为什么读长越长,质量值通常越低——不是测序仪"累了",而是化学反应的累积效率损失在起作用。

1.2 桥式扩增与簇生成:信号放大的工程方案

单个DNA分子的荧光信号太弱,无法被光学系统检测到。Illumina的解决方案是桥式扩增(bridge amplification):把文库DNA片段固定在流动池(flow cell)表面的寡核苷酸引物上,通过反复的延伸-变性-再杂交过程,在原始模板周围形成一个包含约1000个拷贝的克隆簇(cluster)。

簇生成的质量直接决定了后续测序的信号强度。如果簇密度太低,信号弱、信噪比差;如果簇密度太高,相邻簇之间的荧光信号会互相干扰,导致"串扰"(cross-talk),表现为碱基识别错误率升高。这就是为什么上机前必须做文库定量和簇密度优化——不是随便测个浓度就上机,而是要根据测序仪型号和流动池类型,把文库稀释到合适的浓度范围。

实际操作中,我见过太多人用Qubit测完浓度就直接上机,完全忽略了文库的片段大小分布对簇生成的影响。同样质量浓度的文库,片段长度不同,摩尔浓度差异可能达到两倍以上。正确的做法是结合Qubit(测质量浓度)和Bioanalyzer/TapeStation(测片段分布),换算出准确的摩尔浓度,再根据测序仪的推荐范围进行稀释。

1.3 边合成边测序的"边"到底意味着什么

"边合成边测序"这个中文翻译容易让人误解,以为合成和测序是同时进行的两个独立过程。实际上,SBS的"边"指的是在同一个反应体系中交替进行:掺入一个碱基→暂停→拍照→切除→再掺入。每一轮循环只延长一个碱基,读取一个位置的信息。

这个设计带来的一个关键优势是碱基识别的高准确性。因为每个循环只测一个位置,信号是独立的,不会像Sanger测序那样受到片段长度分布的影响。但代价是测序时间与读长成正比——测150个循环就是150轮拍照和切除,这也是为什么HiSeq/NovaSeq跑一次要几十个小时。

另一个容易被忽略的点是索引测序(index sequencing)。双端索引(dual index)的引入是为了解决多重样本混测时的样本拆分问题。每个样本的文库两端各有一个索引序列,测序时在Read 1和Read 2之后分别读取。如果索引序列质量差或存在索引跳跃(index hopping),样本拆分就会出错,表现为"某个样本的数据量异常高,另一个异常低"。这个问题在ExAmp簇生成化学中尤其常见,后来NovaSeq X系列改用XLEAP-SBS化学后有所改善。

2. 文库构建:决定数据质量的上游关键步骤

2.1 从核酸提取到片段化:起始材料的质量控制

文库构建的第一步不是加试剂,而是评估起始材料的质量。很多人拿到DNA或RNA样本后,直接进入建库流程,结果测出来的数据要么重复率高、要么覆盖度不均,回头排查才发现是起始材料降解了。

对于DNA样本,最基本的质控指标是OD260/280比值和电泳图。OD260/280在1.8-2.0之间说明蛋白污染少;电泳图上主带清晰、无明显拖尾说明DNA完整性好。对于FFPE样本或降解严重的样本,需要用qPCR或专门的质量评估试剂盒来判断是否适合建库。

对于RNA样本,RIN值(RNA Integrity Number)是核心指标。RIN≥7的样本适合做转录组测序,RIN在5-7之间的样本需要调整建库策略(比如增加起始量或使用专门针对降解RNA的试剂盒),RIN<5的样本基本不建议做常规转录组,除非是做small RNA或降解组测序。

这里有一个实操中很容易踩的坑:RNA样本的OD260/280比值在1.8-2.0之间并不代表RNA完整。蛋白污染少和RNA没有降解是两回事。我见过不少样本OD比值完美,但RIN只有3-4,上机后数据全是5'端偏好。所以RNA样本必须同时看OD比值和RIN值,缺一不可。

2.2 片段化与末端修复:物理剪切还是酶切

DNA文库构建中,片段化方式的选择直接影响后续的数据质量。目前主流的方法有两种:物理剪切(超声打断,如Covaris)和酶切片段化(如Tn5转座酶)。

物理剪切的优势是片段大小可控、偏差小,适合对覆盖度均匀性要求高的应用(如全基因组测序、WGS)。缺点是需要的起始量较高(通常≥100ng),且操作步骤多、DNA损失大。酶切片段化的优势是起始量低(可以低至1ng甚至更少)、操作简便,适合微量样本或单细胞测序。缺点是片段化位点有偏好性,在基因组某些区域覆盖度会偏高或偏低。

末端修复和加A尾是片段化之后的必经步骤。DNA片段经过剪切后,末端可能是平端、5'突出或3'突出,需要先用T4 DNA聚合酶和Klenow片段补平,再用Taq聚合酶在3'端加一个A碱基。这个A碱基是为了与接头上的T碱基互补配对,所以叫"TA连接"。如果加A效率不高,接头连接效率就会下降,表现为文库转化率低、需要更多PCR循环来扩增,进而引入更多重复。

2.3 接头连接与索引策略:多重测序的基石

接头(adapter)连接是文库构建中最关键的步骤之一。接头不仅提供了测序引物的结合位点,还承载了样本索引(index)信息。Illumina平台的索引策略经历了从单端索引(single index)到双端索引(dual index)的演进。

单端索引只在P7端有一个索引序列,最多区分几十个样本。双端索引在P5和P7端各有一个索引序列,组合数可以达到数千甚至上万,大大提高了多重测序的样本通量。但双端索引也带来了新的问题:索引跳跃(index hopping)。在ExAmp簇生成过程中,游离的未连接接头可能被错误地掺入其他样本的簇中,导致样本拆分错误。

解决索引跳跃的方法有几种:一是使用唯一双端索引(unique dual index,UDI),每个样本的i5和i7索引组合都是唯一的,即使发生跳跃也能被识别和过滤;二是使用索引锚定(index anchoring)化学,减少游离接头的产生;三是在数据分析时使用索引跳跃检测工具(如Picard的CheckIlluminaDirectory)进行校正。

实际操作中,如果做多重测序,我强烈建议使用UDI策略。虽然成本略高,但能避免样本间交叉污染带来的数据解释困难。特别是临床样本,一旦出现样本拆分错误,后果可能是灾难性的。

2.4 文库扩增与纯化:PCR循环数的取舍

接头连接后的文库需要通过PCR扩增来增加总量,同时富集两端都连接了接头的片段。PCR循环数的选择是一个需要权衡的问题:循环数太少,文库产量不够;循环数太多,PCR偏差和重复率会升高。

一般来说,起始DNA量在100ng以上时,6-8个循环就足够了;起始量在10-100ng时,需要8-12个循环;起始量低于10ng时,可能需要12-15个循环。但循环数超过12之后,重复率会显著上升,数据质量下降。

纯化步骤同样关键。常用的方法是磁珠纯化(如AMPure XP),通过调整磁珠与样本的体积比来选择不同大小的片段。比如0.8×磁珠可以去除小于200bp的片段,0.6×可以去除小于300bp的片段。如果纯化不彻底,残留的接头二聚体会占用测序reads,导致有效数据量下降。

我自己的经验是:文库构建完成后,一定要跑一次Bioanalyzer或TapeStation,确认片段分布是否符合预期。如果看到明显的接头二聚体峰(通常在120-150bp左右),说明纯化不彻底,需要重新纯化或增加磁珠比例。如果片段分布过宽,说明片段化条件需要优化。

3. 测序运行:从簇生成到碱基识别的信号链路

3.1 簇生成:ExAmp与XLEAP-SBS的化学差异

簇生成是测序运行的第一步,也是决定信号质量的关键步骤。Illumina平台主要使用两种簇生成化学:ExAmp(排除扩增)和XLEAP-SBS。

ExAmp化学使用模板与P5/P7引物杂交后,通过等温扩增形成簇。这个过程需要精确控制温度和时间,温度波动会导致簇密度不均匀。ExAmp的一个特点是会产生较多的游离接头,这也是索引跳跃问题的主要来源。

XLEAP-SBS是NovaSeq X系列引入的新化学,使用改造过的聚合酶和核苷酸,簇生成效率更高、信号更强、索引跳跃更低。但XLEAP-SBS对文库的质量要求也更高,片段分布不均或残留杂质会直接影响簇生成效率。

无论哪种化学,上机前的文库定量和稀释都是必须严格控制的。以NovaSeq 6000为例,推荐的文库上机浓度通常在1-2nM(具体取决于流动池类型和读长配置)。浓度过高会导致簇密度过高、信号串扰;浓度过低会导致簇密度不足、数据量下降。

3.2 荧光信号采集与碱基识别:从图像到序列

测序循环开始后,每一轮包括三个步骤:掺入(incorporation)、成像(imaging)、切除(cleavage)。掺入步骤中,DNA聚合酶将带荧光标记的可逆终止核苷酸掺入新生链;成像步骤中,光学系统用不同波长的激光激发荧光基团,CCD相机拍摄图像;切除步骤中,化学试剂去除荧光基团和阻断基团,恢复链的延伸能力。

碱基识别(base calling)是将荧光图像转换为碱基序列的过程。Illumina的实时分析软件(RTA)会计算每个簇在每个循环的荧光强度,然后根据四种碱基的特征荧光谱进行判别。如果某个簇的荧光信号太弱或太强,或者四种碱基的信号区分度不够,就会导致碱基识别错误或无法识别(N碱基)。

质量值(Q score)是碱基识别置信度的对数表示。Q30表示错误率为0.1%,Q20表示错误率为1%。一般来说,Q30比例是衡量测序质量的核心指标,Illumina推荐Q30≥80%(对于大多数应用)。但Q30比例并不是越高越好——如果Q30比例异常高(比如>95%),可能意味着簇密度过低或信号饱和,实际数据量可能不足。

3.3 读长选择与测序模式:单端还是双端

读长和测序模式的选择取决于应用场景。单端测序(single-end)只读一个方向,适合基因表达定量、small RNA测序、ChIP-seq等应用。双端测序(paired-end)读两个方向,适合全基因组测序、变异检测、宏基因组测序等需要高覆盖度和高准确性的应用。

读长的选择也需要权衡。短读长(如50bp)测序速度快、成本低,适合大规模样本的快速筛查;长读长(如150bp或300bp)提供更多信息,适合需要精确拼接或变异检测的应用。但读长越长,信号衰减越明显,3'端的质量值通常低于5'端。

一个常见的误区是"读长越长越好"。实际上,对于某些应用(如基因表达定量),50bp的单端测序就足够了,用150bp双端测序只会增加成本和分析复杂度。选择读长时,应该根据具体应用的需求来决定,而不是盲目追求长读长。

3.4 测序过程中的实时监控与异常判断

测序运行过程中,实时分析软件会提供一系列质控指标,包括簇密度、Q30比例、错误率、信号强度等。这些指标可以帮助判断测序是否正常进行。

如果簇密度低于预期,可能是文库浓度不足或簇生成效率低;如果Q30比例在早期循环就快速下降,可能是测序试剂问题或文库质量差;如果某个碱基的荧光信号异常,可能是光学系统或流动池问题。

我自己的经验是:在测序开始后的前10-20个循环,一定要检查Q30比例和信号强度。如果这两个指标正常,后续大概率没问题;如果异常,尽早终止运行可以节省试剂和时间。很多人等到测序跑完才发现质量差,这时候已经浪费了几十个小时和大量试剂。

4. 下机数据分析:从FASTQ到生物学结论

4.1 FASTQ文件的结构与质量评估

测序完成后,下机数据通常以FASTQ格式存储。每个read包含四行:第一行是序列标识符(以@开头),第二行是碱基序列,第三行是分隔符(以+开头),第四行是质量值字符串(每个字符对应一个碱基的质量值)。

质量评估的第一步是FastQC或MultiQC。FastQC会生成一系列质控图表,包括:Per base sequence quality(每个位置的质量值分布)、Per sequence quality scores(每条read的平均质量值分布)、Per base sequence content(每个位置的碱基组成)、Sequence duplication levels(重复序列比例)、Adapter content(接头污染比例)等。

解读这些图表需要经验。比如,如果Per base sequence quality显示3'端质量值下降,这是正常的信号衰减;如果5'端质量值就低,可能是测序早期的化学问题。如果Per base sequence content显示某个位置的碱基组成严重偏斜(比如A和T的比例远高于G和C),可能是文库构建时的偏差或污染。

4.2 接头修剪与质量过滤:数据清洗的核心步骤

原始FASTQ数据中通常包含接头序列和低质量碱基,需要进行修剪和过滤。常用的工具包括Trimmomatic、cutadapt、fastp等。

接头修剪的关键是准确识别接头序列。Illumina平台的接头序列是已知的,但不同建库试剂盒的接头序列可能略有差异。如果接头修剪不彻底,残留的接头会影响后续的比对和变异检测。如果修剪过度,可能误伤真实序列。

质量过滤的参数设置也需要根据应用场景调整。一般来说,滑动窗口质量修剪(如Trimmomatic的SLIDINGWINDOW:4:20)可以去除3'端低质量区域;最小长度过滤(如MINLEN:36)可以去除过短的read。但对于某些应用(如small RNA测序),最小长度需要设置得更低。

我自己的经验是:修剪后的数据一定要重新跑一次FastQC,确认接头污染被清除、质量值分布改善。如果修剪后接头含量仍然很高,说明修剪参数需要调整,或者文库本身接头二聚体污染严重。

4.3 比对与定量:从reads到表达量或变异

清洗后的reads需要比对到参考基因组。常用的比对工具包括BWA(DNA)、STAR(RNA)、Bowtie2(通用)等。比对效率是衡量数据质量的重要指标——对于人类基因组,BWA的比对率通常在95%以上;对于转录组,STAR的比对率通常在80-90%以上。

比对完成后,根据应用场景进行后续分析。对于转录组测序,需要用featureCounts或HTSeq进行基因水平或转录本水平的定量,然后用DESeq2或edgeR进行差异表达分析。对于全基因组测序,需要用GATK或DeepVariant进行变异检测,然后进行变异注释和过滤。对于ChIP-seq,需要用MACS2进行峰检测,然后进行峰注释和motif分析。

这里有一个容易被忽略的点:比对效率低不一定意味着数据质量差。如果样本本身有大量重复序列或污染,比对效率低是正常的。但如果比对效率突然下降(比如从95%降到70%),就需要排查原因——可能是参考基因组版本不对、样本污染、或者测序质量下降。

4.4 单细胞与空间转录组:SBS数据的新兴应用场景

近年来,单细胞测序和空间转录组成为SBS数据的重要应用场景。单细胞测序(如10x Genomics平台)在文库构建时加入了细胞条形码(cell barcode)和UMI(unique molecular identifier),可以在单细胞水平上定量基因表达。空间转录组则在保留组织空间信息的同时进行转录组测序。

这些应用对SBS数据的要求更高。单细胞测序需要高测序深度来捕获低表达基因,同时需要低重复率来保证UMI的准确性。空间转录组需要高覆盖度来确保每个空间点的数据量足够。如果测序质量不达标,单细胞测序可能无法区分细胞类型,空间转录组可能无法识别空间表达模式。

处理单细胞数据时,常用的工具包括Cell Ranger(10x官方流程)、Scanpy(Python)、Seurat(R)等。这些工具会从FASTQ数据开始,完成比对、定量、细胞过滤、聚类、差异表达分析等步骤。但需要注意的是,Cell Ranger的默认参数不一定适合所有样本——如果样本的细胞活力低或背景噪音高,需要调整参数或使用其他工具进行预处理。

5. 那些手册上不会写的实操经验

5.1 文库构建中的"隐形杀手":残留磁珠与乙醇

磁珠纯化是文库构建中最常用的纯化方法,但磁珠残留是很多问题的根源。如果磁珠没有完全去除,残留的磁珠会干扰后续的酶促反应,导致文库产量低或质量差。同样,乙醇残留也会抑制酶活性,影响PCR扩增效率。

我自己的做法是:磁珠纯化后,一定要用80%乙醇洗两次,并且尽量吸干残留乙醇。洗完后开盖晾干2-3分钟,但不要晾太久,否则磁珠会开裂。洗脱时用无核酸酶水或TE缓冲液,不要用含EDTA的缓冲液(EDTA会螯合镁离子,抑制后续酶反应)。

5.2 测序上机前的"最后一公里":文库变性与稀释

文库上机前的变性和稀释是最后一步,也是最容易出错的一步。文库必须经过变性(通常用0.1N NaOH)才能与流动池上的引物结合。如果变性不彻底,双链文库无法杂交到流动池上,导致簇密度极低。

稀释时需要注意:稀释后的文库不能长时间放置,因为变性后的单链文库会逐渐重新退火或降解。一般来说,稀释后的文库应在1-2小时内上机。如果必须等待,可以放在冰上或4度冰箱,但不要超过4小时。

另一个常见问题是稀释计算错误。文库的摩尔浓度需要根据片段大小换算,公式是:摩尔浓度(nM)= 质量浓度(ng/μL)÷(片段大小(bp)× 660)× 10^6。如果片段大小估计错误,摩尔浓度就会偏差,导致上机浓度不合适。

5.3 数据质量差时的排查链路

当测序数据质量差时,排查需要从上游到下游逐步进行。以下是我常用的排查链路:

问题表现可能原因排查方法
簇密度低文库浓度不足、变性不彻底检查文库定量和变性步骤
Q30比例低测序试剂问题、文库质量差检查试剂批号和文库片段分布
重复率高PCR循环数过多、起始量不足检查建库记录和起始量
接头污染高纯化不彻底、接头二聚体检查Bioanalyzer图和纯化步骤
比对率低参考基因组不对、样本污染检查参考基因组版本和样本来源
索引跳跃高游离接头、索引策略不当检查索引策略和簇生成化学

这个排查链路的核心逻辑是:先确认上游步骤没有问题,再排查下游。很多人在数据质量差时直接怀疑测序仪,但实际上大部分问题出在文库构建或样本质量上。

5.4 从数据到结论:分析中的常见误区

数据分析阶段有几个常见的误区。第一个是过度依赖默认参数。比如,用STAR比对时,默认参数可能不适合某些样本(如降解RNA样本需要调整--outFilterMismatchNoverLmax参数)。第二个是忽略批次效应。如果样本分多批测序,批次效应可能掩盖真实的生物学差异,需要用ComBat或limma等工具进行校正。第三个是过度解读低表达基因。低表达基因的定量噪音大,差异表达分析时容易产生假阳性,需要设置合理的表达量阈值。

我自己的经验是:分析结果一定要用独立方法验证。比如,差异表达分析发现的候选基因,可以用qPCR验证;变异检测发现的候选变异,可以用Sanger测序验证。只有经过验证的结果,才能放心地写进论文或报告。

5.5 单细胞数据处理的特殊注意事项

单细胞测序数据的处理与批量测序有显著差异。首先,细胞过滤是关键步骤——需要根据线粒体基因比例、检测到的基因数、UMI总数等指标过滤掉死细胞、双细胞和低质量细胞。其次,批次校正在单细胞分析中尤为重要,因为不同批次之间的细胞可能无法对齐。常用的批次校正工具包括Harmony、Seurat的CCA整合、scVI等。

另一个需要注意的是UMI去重。UMI是为了区分PCR重复和真实生物学重复而设计的,但如果UMI去重不彻底,会导致定量偏差。Cell Ranger会自动进行UMI去重,但如果使用其他工具(如STARsolo),需要手动设置相关参数。

最后,单细胞数据的可视化需要谨慎。t-SNE和UMAP是常用的降维可视化方法,但它们的输出受到参数设置的影响很大。同样的数据,不同的perplexity或n_neighbors参数可能产生完全不同的聚类结果。所以,可视化结果需要结合生物学知识进行解释,不能仅凭图上的聚类来判断细胞类型。

6. 从SBS到生物学发现:一个完整案例的拆解

6.1 案例背景:肿瘤样本的转录组测序

假设我们有一个肿瘤样本和对应的癌旁正常组织,想做转录组测序来寻找差异表达基因。这个案例涵盖了从样本处理到数据分析的完整流程,可以很好地说明SBS技术在实际研究中的应用。

样本处理阶段:肿瘤样本和癌旁组织分别提取RNA,用Agilent Bioanalyzer检测RIN值。假设肿瘤样本RIN=8.5,癌旁样本RIN=9.0,都符合建库要求。用Illumina Stranded mRNA建库试剂盒构建文库,起始量500ng,PCR循环数10个。

6.2 建库与测序的关键决策点

建库时选择链特异性文库(stranded library),因为链特异性信息可以帮助区分正义链和反义链的转录本,对于发现反义转录本和重叠基因非常重要。接头选择UDI策略,因为样本数量多,需要避免索引跳跃。

测序时选择PE150(双端150bp),因为需要较高的覆盖度和准确性来检测低表达基因和可变剪接。上机浓度根据NovaSeq 6000的推荐范围设置为1.5nM,目标数据量为每个样本40M reads。

6.3 数据分析流程与结果解读

下机数据用fastp进行质量过滤和接头修剪,然后用STAR比对到人类参考基因组(GRCh38),用featureCounts进行基因水平定量,最后用DESeq2进行差异表达分析。

分析结果显示,有1250个基因在肿瘤样本中显著上调,830个基因显著下调(|log2FC|>1,padj<0.05)。上调基因中富集了细胞周期和DNA复制相关通路,下调基因中富集了细胞凋亡和免疫应答相关通路。这些结果与肿瘤细胞的增殖特征和免疫逃逸机制一致。

6.4 从差异基因到生物学假设

差异表达分析只是第一步,后续需要将差异基因与生物学假设联系起来。比如,上调的细胞周期基因可能提示肿瘤细胞增殖活跃,可以作为潜在的治疗靶点;下调的免疫应答基因可能提示肿瘤微环境的免疫抑制,可以进一步做免疫浸润分析。

这个案例说明,SBS技术本身只是工具,真正的价值在于如何将测序数据转化为生物学发现。从样本处理到数据分析,每一步都需要严谨的操作和深入的解读,才能得到可靠的结果。

7. 写在最后:一些个人体会

做了这么多年测序相关的实验和分析,我最大的体会是:SBS技术的核心难点不在测序仪本身,而在上游的样本处理和文库构建。测序仪是高度自动化的,只要文库质量合格,它就能产出合格的数据。但如果文库质量差,再好的测序仪也救不回来。

另一个体会是:数据分析不是"跑流程",而是"做判断"。同样的数据,不同的参数设置可能得到不同的结果。分析人员需要理解每一步的原理和假设,才能做出合理的判断。盲目套用流程或默认参数,很容易得到错误或不可靠的结论。

最后,质量控制贯穿始终。从样本提取到文库构建,从测序运行到数据分析,每一步都需要质控。只有每一步都合格,最终的结果才可靠。我见过太多人跳过质控步骤,结果在最后发现数据不可用,浪费了大量时间和经费。与其事后补救,不如事前做好质控。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询