跳转到正文

10X单细胞转录组常见问题

返回

10X单细胞转录组常见问题

发布于: 更新于:
统计加载中...

1 生产环节

1.1 单细胞转录组 3’和 5’有什么区别?

方法相似,主要为 10x 文库捕获 plyadenylated 尾的转录本时不同。都是使用 ploydT 引物反转录,3’ polydT 引物位于 gel bead oligo(凝胶珠寡头上),而 5’ polydT 供给是在 RT 引物中。

10X单细胞转录组常见问题 2026 06 22 1ff89849 799b 46bd 818b b85d8e3038a0
图 1:Single Cell 3’ v3.1 Gene Expression Library

1.2 单细胞/细胞核悬液含有大量碎片,如何处理?

细胞结团、碎片和纤维会干扰准确的细胞或细胞核计数,并在生成乳化凝胶珠 (GEM) 时导致芯片故障。去除碎片和细胞结团对于使用自动计数仪进行准确的细胞计数也很重要。 此外,碎片中的环境 RNA 可能会判断成细胞,导致数据中出现更多噪声,并且算法难以调 用细胞。但是,有些碎片可能是不可避免的。虽然对于样品中可能存在的碎片没有严格的界 限,但以下示例可以更好地了解什么是“低碎屑”样品: 10X单细胞转录组常见问题 2026 06 22 6fc4260a 522b 4e66 a3d0 fee237ee59f9

1.3 可以将样本储存在组织保存溶液中吗?

理想的情况下,新鲜样本能最大程度地提高样本质量;然而,有些样本可能需要进行保存以方便运输、储存或在单细胞流程中提供更大的灵活性。细胞悬液的冷冻保存是长期储存和运输的常用方法,但在采集样本的过程中可能无法进行冷冻保存或组织解离离。组织样本储存解决方案是一种有吸引力的替代方案,可以减缓组织样本中细胞的死亡,同时也 只需在 4℃条件下储存,也不需要冷冻保存能力。

1.4 新鲜细胞与解冻后细胞的基因表达是否有差异?

10x 官方做过测试,详情请见:Are there gene expression differences between fresh and frozen-thawed cells? 使用单细胞 3’转录组比较了来自同一供体的新鲜和冻融人 PBMC。新鲜和冻存的 PBMC 之间的整体基因表达高度相关。除已知对冻融条件敏感的红细胞 (RBC)外,多 个供体的细胞类型分布在低温保存前后保持一致。

1.5 我有血液做单细胞测序,是送全血好还是送冻存的 PBMC 好?

两种方案其实都是可以的。 全血运输对样本本身不会造成很大的影响,细胞数目,细胞活性等 90%以上都是可以达 到的。一般运输对血液造成的最大影响是基因表达的变化,会影响降维和聚类,但是基因 表达的变化在血液离体 4-6h 内就会发生,所以只要运输其实都会有基因表达的变化的。 如果担心基因表达的变化最好的办法是在血液离体后 30min 内提取 PBMC 后冻存运输, 但是冻存运输也有缺点,可能会导致细胞死亡比较多,就需要去除死细胞,有可能会导致 细胞群体的比例发生变化,但冻存运输对基因表达是基本没有什么变化的。两种方案有利 有弊,可以均衡考虑。例如有些客户的医院不具备提取 PBMC 的能力,所以选择直接寄送 血液。

1.6 10x 分 scRNA-seq 和 snRNA-seq,该如何选择?

使用细胞还是细胞核作为起始材料取决于几个因素,包括样本类型、样本的运输和储存以 及所选的分析方法。如果可获得新鲜组织,我们建议分离成细胞。对于冷冻的组织样本、 细胞类型大的细胞以及很脆弱的细胞(如神经元和肝细胞)或难以解离的组织,细胞核则是一个不错的选择。

1.7 细胞悬液的制备过程中是否会影响基因的表达?

目前常用的方法中,不管是酶消化还是机械操作都会不可避免的对细胞产生影响,前者会使细胞产生应激反应,后者则容易损伤细胞,进而影响细胞活性。所以,在单细胞测序实验设计时,设置对照是非常重要的。前述的这些影响,在case和control中同样存在,我们关注case和control的差异表达基因,就可以去除实验的系统误差,找到决定感兴趣生物学过程的关键基因。

1.8 在样本质检合格的情况下,一般情况下细胞数在预期细胞数的 0.5-2 倍之间,细胞数与预期相差较大的原因有哪些?

一:样本质量与特点 样本的活性低,有核率低,含有红细胞啊等等 二:细胞计数的准确性 目前的细胞计数的方式是通过台盼蓝和 AOPI 计数的方式,同时呢计数仪的算法导致的计 数不准的情况,这个方法并不完全准确,有时候会测到的活性很好,实际上没那么好,一 般来说会计数 3 次取平均来代表最终的计数结果。 三:油包水的状态 油包水过程本身没法质控的,一般来说是稳定的,但有一些时候会不正常,极端的时候就 是油包水基本没生成,这个可被肉眼观察发现,但界于中间的一些状态无法肉眼判断,比 如油包水实际效率下降了,但仍然生成了乳浊状态,这个也有可能是细胞数偏差的一个原因;

1.9 我的样本不同时间获得,会有批次效应么?

10x 单细胞测序,一个芯片同时只能测 8 个样或 16 个样,同时呢,样品多的情况下,时间批次,处理人员,试剂批次,实验环境的不同都会有批次效应,但在后续分析时,会通过生信手段例如 Harmony,Seurat,fastMNN 等去除批次效应。

2 标准分析环节

2.1 为什么样本中线粒体基因表达较高?

线粒体基因在多数细胞中均有表达,其表达水平与细胞类型,状态有关。 高表达水平可能原因:

  1. 样本质量差,较多的细胞处于凋亡或溶解状态,如果只是单个或 较少 cluster 的细胞含有差异上调的线粒体基因和较低的总 UMI count,这个 cluster 可能为死的 或凋亡的细胞。
  2. 样本的独特性,如肿瘤或肝脏组织代谢旺盛,线粒体基因表达水平较高。

2.2 为什么样本中核糖体蛋白基因表达较高?

单细胞 3 ‘文库包含比对到核糖体蛋白转录本(Rps, Rpl)的 reads。根据细胞类型不同,一 般规律为: 10X单细胞转录组常见问题 2026 06 22 62188a11 1392 4494 abc3 3bbb78936fcd

在数据分析过程中解决核糖体基因的表达问题,可以采用以下方法:

  1. Exclude PCs (Principal Components) that correlate with ribosomal protein genes. This amounts to subtracting effects that are presumably technical.
  2. Only include in the PC analysis genes that are “highly variable”. We do this by selecting the genes with the highest dispersion across the dataset and performing PCA on those genes only. The Seurat package uses a similar approach. 详情见:What fraction of reads map to ribosomal proteins?

2.3 在 Cell Ranger 分析与 cloup 中,是如何计算“Log2 Fold Change”的?

“Log2 Fold Change”是归一化平均基因 UMI 计数,每个 cluster 或组中,相对于所有其他 cluster 或组的比值。
计算公式:在 Log2 Fold Change 中引入了一个 pseudocount ‘log2_fold_change’:np.log2((1+gene_sums_a)/(1+size_factor_a)) np.log2((1+gene_sums_b)/(1+size_factor_b)) 详情见:How is “Log2 fold change” calculated?

2.4 什么是测序饱和度?

这个词量化了来自已经检出到的 UMI 的 fraction of reads 的比例。更具体地说,这是可靠 映射的部分,有效的细胞 barcode,有效的 UMIreads 是非唯一的(匹配现有的细胞 barcode,UMI, 基因组合)。反映文库的复杂程度。 计算公式:Sequencing Saturation = 1 - (n_deduped_reads / n_reads) n_deduped_reads = Number of unique (valid cell-barcode, valid UMI, gene) combinations among confidently mapped reads. n_reads = Total number of confidently mapped, valid cell-barcode, valid UMI reads. 注意,该分数的分子是 n_deduped_reads,而不是定义中提到的非惟一读取。n_deduped_reads 是惟一性的程度,而不是复制/饱和的程度。因此,我们使用 1-(n_deduped_reads / n_reads)来 测量饱和度。 详情见:How is sequencing saturation calculated?

2.5 影响测序深度的因素?

测序饱和度是在实验中对文库复杂度进行测序的分数。测序饱和度的反比可以解释为一 个新的 read 所能找到的新转录本的数量。如果测序饱和度为 50%,则意味着每 2 个新的 reads 将检测到 1 个新的 UMI count (unique transcript)。相比之下,90%的测序饱和度意味着需要 10 个新的 read 才能获得一个新的 UMI 计数。 测序饱和度取决于文库的复杂度和测序深度。不同的细胞类型有不同数量的 RNA,因此最 终文库中不同转录本的总数也不同(也称为文库复杂性)。随着测序深度的增加,可以检测到 更多的基因,但根据细胞类型的不同,在不同的测序深度,这一过程会达到饱和。 测序深度也影响测序饱和度;通常,测序 read 越多,可以检测到的额外的独特转录本就越多。 但受到库复杂性的限制。 详情见:What is sequencing saturation?

2.6 10x Cell Ranger 依据 barcode 鉴定 cell 的原则?

Cell Ranger 软件 3.0 及以上版本,依据 barcode 识别有效细胞 cell,分为两步: 第一步,使用 cutoff 值,识别高 RNA 含量的细胞。Cell Ranger 将期望捕获的细胞数量 N(默认 3000 个细胞)中 barcodes 的 UMI 总数由高到低进行排序,取前 N 个 UMI 数值的 99%分位数为最 大估算 UMI 总数(m),将 UMI 数目超过 m/10 的 barcodes 用于细胞计数。 第二步,选择一组具有低 UMI 计数的 barcode,表示“空 GEM”分区,建立背景模型。利用 平滑算法,找到“空 GEM”集合中的 RNA 图谱;再将第一步中未作为细胞计数的 barcode 中 RNA 图谱与背景模型进行比较,其 RNA 图谱与背景模型存在较大差异的 barcode 用于细胞 计数。

2.7 差异基因展示中,小提琴图怎么看?

小提琴图反映了该 cluster 的细胞中,某一个基因的表达情况,及密度分布。小提琴图的 最大宽度取决于给定 cluster 内基因在细胞内的表达丰度,与 cluster 内细胞数、cluster 间细胞数 差异无关;基因在 cluster 的大多数细胞表达为 0,小提琴图的最大宽度在基因丰度为 0 时实现, 这样高表达丰度的基因在小提琴图上的宽度很小(呈一条线)。 详情见:VlnPlot: probability density plots · Issue #297 · satijalab/seurat

2.8 Cell Ranger 网页版报告,第二页差异基因的筛选规则是什么?

各 cluster 中差异高表达的基因,UMI count>1,log2foldchang>0,p-value≤0.1。 p-value:基于负二项检验,p 值表示的是差异显著性的度量,报告中显示的 p 值是经过多次 Benjamini-Hochberg 校正的。

2.9 如何理解 Graph-based 这种聚类方法?

是基于图的聚类算法,通过构建稀疏邻近的图,然后再图中寻找高度连接的 Louvain 算 法。k 值是细胞数量值取对数得到;在聚类的过程中,若 cluster 中没有差异基因,则会进行 进一步的层次聚类,直到没有可以合并的 cluster。可以理解为系统自动分群。

2.10 10x 的 UMI 序列有多少种,如何认为 UMI 序列是有效的?

10x 的 UMI 是随机序列序列,V2 试剂 10bp,V3 试剂 12bp,因此存在 4^10 或 4^12 种可能性。 以物种人为例,其参考基因组注射已经非常完善,总基因数不足 4 万,所以 10x UMI 的种类 足以覆盖细胞中全部 mRNA。认为有效 UMI 的规则如下:

  1. Must not be a homopolymer, e.g. AAAAAAAAAA;
  2. Must not contain N;
  3. Must not contain bases with base quality < 10;
  4. UMIs that are 1 mismatch away from a higher-count UMI are corrected to that UMI if they share a cell barcode and gene.

2.11 Cell Ranger 的比对规则是什么?

比对到基因组:利用 STAR 比对,比对速度快,灵敏度高,允许基因的可变剪切存在。 比对完之后,利用 GTF 文件将 reads 溯源回外显子区、内含子区、基因间区。如果一条 read 的 50%以上与外显子有交集,那么就认为它在外显区;如果不在外显子区,与内含子有交集, 那么就认为它在内含子区;与外显子、内含子都没有交集,那么就认为在基因间区。

利用 MAPQ 辅助判断:如果 reads 比对到了一个外显子区,同时也比对到了 1 个或多个的非外 显子区,更相信它在外显子区;然后看 MAPQ 值,值越大越可信,如果 MAPQ 的值为 255 的话,那么就可以非常确定它比对到了外显子区。

比对到转录组:如果上面得到的外显子区域 reads 同时比对上有注释转录本上的外显子,并 且在同一条链上,那么认为这个 reads 也比对到了转录组;如果只比对到单个基因的注释信 息,那么认为它是特异比对到转录组的(uniquely /confidently mapped ),这样的 reads 才会拿来 做接下来的 UMI 计数。

2.12 一般需要对细胞进行哪些过滤操作?

人和小鼠模式生物,针对以下内容进行了过滤:

  1. 血红蛋白基因占比情况;
  2. 线粒体基因占比情况;
  3. barcode 中过高的 UMI 与基因数。
    对于其他物种,若提供血红蛋白基因或线粒体基因列表,也可以进行过滤。

2.13 10x 单细胞转录组 cloup 软件如何使用?

10X 官网有教学视频:Loupe Browser | Official 10x Genomics Support

3 个性化分析环节

3.1 3’转录组与 5’转录组是否可以整合分析?

理论上是可以的,但需要注意 aggr 不能矫正不同试剂带来的影响。对单细胞 RNA-seq 数 据中的系统效应或批量效应进行归一化和校正是目前比较活跃的研究领域,目前 10x 还没有 一个具体的建议。从文献中可以看出,R 中有许多包,比如 Seurat、scran 和 scone,试图解决 这些问题。 详情见:Can I combine gene expression data from 3’ and 5’ assay chemistries?

3.2 K-means 聚类,如何选择最优 K 值?

推荐使用手肘法(SSE)与轮廓系数法(Silhouette Coefficient)结合,判断最优 K 值。 手肘法的核心指标是 SSE( sum of the squared errors,误差平方和),随着聚类数的增大,样本划分会更加精细,每个簇的聚合程度会逐渐提高,因此误差平方和 SSE 会逐渐变小。但当 K 小于真实聚类数时,由于 K 的增大会大幅增加每个簇的聚合程度,所以 SSE 的下降幅度会很 大;当到达真实聚类数时,再增加所得到的聚合程度回报会迅速变小,所以 SSE 的下降幅度 会骤减,随着值的继续增大而趋于平缓,也就是说 SSE 和的关系图会形成一个手肘的形状, 而肘部对应的值就是数据的真实聚类数。轮廓系数法的核心指标是轮廓系数(Sihee Cefficie), 该方法结合了聚类的凝聚度(Chei)和分离度(Seaai),用于评估聚类的效果。该值处于-1~1 之 间,值越大,表示聚类效果越好。 轮廓系数法确定出的最优值不一定是最优的,需要根据 SSE 进行辅助选取,以上内容仅供 参考,请结合实际情况,合理选择最优 K 值。 详情见:K-means聚类最优k值的选取_最优聚类数目k的确定-CSDN博客

3.3 是否需要将 UMI 转化为 TPM, RPKM 或 FPKM?

不需要。10x 也不建议如此。Cell Ranger 分析使用唯一标识 UMI 用于基因表达水平的定 量,后续分析(包括 Cell Ranger 及其他分析软件)也均基于 UMI。 此外,10X 单细胞与传统转录组测序不同,在传统的 RNA-seq 数据中,完整的转录本被片段 化,然后 cDNA 合成、末端修复和 adapter 连接等。在这个流程中,从长文本中抽取片段的概 率要高于从短文本中抽取片段的概率。因此,根据 reads 长度(例如 TPM、RPKM、FPKM)对 读取计数进行规范化是有意义的。而在 10x 单细胞 3’或 5’的实验中,这种基因长度偏差并不存 在。所以,不建议根据基因长度对 UMI 计数进行标准化。 详情见:Should I calculate TPM, RPKM or FPKM, instead of counts for 10x Genomics data?

3.4 Cell Ranger 与 Seurat 软件分析的区别?

二者侧重不同,Cell Ranger 侧重于拆库定量,可以得到 cell-gene 矩阵,初步的细胞聚类 分型结果及 cloup 可视化软件。Seurat 分析基于 Cell Ranger 结果进行,在参数调整,差异基因 展示,细胞周期分析等方面更具优势,可进行数据挖掘。但 Seurat 结果的可视化操作不佳, 需要导入 cloup 中,而 cloup 只可通过 Cell Ranger 获得,所以二者相辅相成,缺一不可。

3.5 细胞类型定义的方法有哪些?

  1. 传统方法:根据文献积累,细胞类型相关的数据库:BD Rhapsody;CellMarker等,根据marker基因表达情况,结合聚类热图,t-SNE图或小提琴图等综合判断。此方法需要客户主导,信息辅助,共同完成,marker基因的选取较为关键,但该方法适用于大部分物 种。
  2. 一些单细胞分析软件,如:Seurat和 monocle,可通过预测,辅助 进行细胞类型定义。
  3. 细胞定义软件SingleR,是2019年发表在Nature Immunology杂志上面的细胞类型鉴定的工具,可读取10x Cell Ranger分析结果,也可与Seurat工具无缝对接。该软件基于超几何分布进行假设检验,以判断每个cell或cluster的最可能的细胞类型。该软件只适用于人和小鼠。
  4. 其他在线分析工具等,可参考相关链接:SuperCT: sc-RNA-seq 单细胞细胞类型定义在线工具 - 简书

3.6 一些文章中对单细胞数据去除了细胞周期基因,是否有必要去除?

细胞周期阶段的异质性,特别是有丝分裂细胞在 S 期和 G2/M 期之间的过渡,可以驱动大 量的转录组可变,可能会掩盖某些生物信号。为了减弱这种可能存在的批次效应,一些学者 会去除该变异源。当然,这需要客户根据自己的研究方向与内容,判断是否需要。 我们提供的结果,默认不去除细胞周期因素影响,因为这不适用于全部客户数据。若客户有 需求,可以分析。 详情见: Cell-Cycle Scoring and Regression

3.7 Reads Mapped Confidently to Transcriptome < 60%怎么办?

该指标一般适用于人或小鼠等模式生物,其他物种该指标不一定适用。 对于一些特殊组织,也不一定适用,如,一般造血干细胞、细胞核与胚胎组织等,未剪切的 RNA 含量较高,因此内含子比对会偏高,而外显子比对偏低。建议用前体 RNA 做参考基因 组,再进行比对,可能会提升基因数。 前体 RNA 参考基因组为将 GTF 文件中第 3 列替换成外显子后再次生成的参考基因组。

3.8 为什么相同的数据 Cell Ranger 分析后,得到的 t-SNE 图会不一样?

t-SNE 图是展示对细胞聚类一种展示形式,与 PCA 不同,t-SNE 的非线形降维是不确定的, 但这不影响数据分析结果。 10X 官方回复:“In contrast to, e.g., PCA, t-SNE has a non-convex objective function. The objective function is minimized using a gradient descent optimization that is initiated randomly. As a result, it is possible that different runs give you different solutions.” Thus subtle differences like you observed between runs are not a concern. For more information please see: https://lvdmaaten.github.io/tsne/

3.9 Cell Ranger 可以去除多细胞捕获吗?

不可以。Cell Ranger 分析不能识别多细胞捕获,也不能去除多细胞。但可以通过细胞的 UMIs 或检测到的基因数目明显偏离异常,来进行过滤多细胞捕获的可能。 详情见:Are there methods for identifying multiplets?

3.10 Reads Mapped to Genome 明显低于常规水平?

除样本中有不同物种细胞混合外,一般原因为物种与参考基因组不匹配。

3.11 相同的物种,但参考基因组版本不一致,可以一起整合分析吗?

不能。要整合分析的数据,必须有相同的参考基因组。

3.12 单细胞分析 Cell Ranger 可以分析多少细胞?

理论上 Cell Ranger 可以分析 500~10000 个细胞,细胞数太少会导致分析结果不准确。 详情见:What is the minimum number of cells that can be profiled in Universal 3’ and 5’ Gene Expression assays?

3.13 影响基因检出的因素有哪些?

  1. 主要与样本类型及状态有关,一般外周血多为1000~3000,干细胞和大脑可多达5000+, 不同的癌种,基因检出数也可存在数倍的差异;
  2. 随着测序饱和度的增加,在一定程度上会增加基因检出数,一般测序饱和度达到80%即 可,但并不是硬性指标;
  3. 参考基因组的注释是否完善会影响基因检出,若有特殊物种,则需要提供较为完善的参 考基因组。
  4. 对于一些特殊组织,如,一般造血干细胞、细胞核与胚胎组织等,未剪切的RNA含量较 高,因此内含子比对会偏高,而外显子比对偏低。建议用前体RNA做参考基因组,再进行 比对,可能会提升基因数。

3.14 响捕获细胞数目的因素有哪些?

主要影响细胞捕获数目多少的是样本处理成单细胞悬液的过程——细胞浓度与活性。样 本物种类型及组织特点多样,如骨组织,灌洗液,成熟心肌组织或植物原生质体等,需要较 为特殊的处理方式,以保障细胞活性;外周血单核细胞分离时需要注意避免其他细胞的污染 等。 单细胞研究板块致力于样本制备,目前已成功测试过脾脏、肾脏、乳腺癌原位灶及转移灶、 人-小鼠移植瘤、小鼠结肠癌原位灶与结直肠等。

3.15 拟时分析有什么要求?

拟时分析默认使用 Monocle2 软件(之后可能会随着软件更新,更换版本),单样本与 多样本均可进行拟时分析,需要客户提供在哪个/些样本上,哪种“分组”(可以是分群方式, 样本,时间段,组间等)的基础上进行拟时分析。拟时分析针对于不同细胞类型的分化轨迹 或者是发育方向,如果一个样本可以涵盖所关注的所有细胞类群是可以实现的,但反之如果 该样本不能涵盖足够的样本类型,建议取多样本直至包含关注的细胞亚群,结果会更准确。




评论