Seurat 单细胞转录组测序数据分析教程(二)——python(scanpy)
文章参考至scanpy官网,做了一个更详细的解读。
本教程探讨了 scanpy 的可视化可能性,分为三个部分:
嵌入的散点图(例如 UMAP、t-SNE)
使用已知标记基因鉴定簇
差异表达基因的可视化
在本教程中,我们将使用来自 10x 的数据集,其中包含来自PBMC的 68k 个细胞。Scanpy 在其分布中包括该数据集的简化样本,该数据集仅包含 700 个细胞和 765 个高度可变的基因。该数据集已经过预处理和 UMAP 计算。
在本教程中,我们还将使用以下文献标记:
B细胞:CD79A、MS4A1
等离子: IGJ (JCHAIN)
T细胞:CD3D
NK:GNLY,NKG7
髓系:CST3、LYZ
单核细胞:FCGR3A
树突状:FCER1A
嵌入的散点图
import scanpy as sc
import pandas as pd
from matplotlib.pyplot import rc_context
sc.set_figure_params(dpi=100, color_map = 'viridis_r')
sc.settings.verbosity = 1
sc.logging.print_header()
加载 pbmc 数据集
pbmc = sc.datasets.pbmc68k_reduced()
# inspect pbmc contents
pbmc
基因表达和其他变量的可视化
对于散点图,要绘制的值作为参数给出color。这可以是任何基因或 中的任何列.obs,其中.obs是包含每个观察/细胞注释的 DataFrame,请参阅AnnData了解更多信息。
# rc_context is used for the figure size, in this case 4x4
with rc_context({'figure.figsize': (4, 4)}):
sc.pl.umap(pbmc, color='CD79A')

可以给 多个值color。在下面的示例中,我们将绘制 6 个基因:‘CD79A’、‘MS4A1’、‘IGJ’、CD3D’、‘FCER1A’ 和 ‘FCGR3A’ 以了解这些标记基因的表达位置。
此外,我们将绘制另外两个值:n_counts这是每个单元格的 UMI 计数(存储在 中.obs),bulk_labels这是一个包含来自 10X 的单元格原始标记的分类值。
每行的图数由ncols参数控制。可以使用调整绘制的最大值vmax(同样vmin可以用于最小值)。在这种情况下,我们使用p99,这意味着使用 99 个百分位数作为最大值。如果 vmax 想要分别为多个地块设置,则最大值可以是数字或数字列表。
此外,我们正在使用frameon=False删除图周围的框并s=50设置点大小。
with rc_context({'figure.figsize': (3, 3)}):
sc.pl.umap(pbmc, color=['CD79A', 'MS4A1', 'IGJ', 'CD3D', 'FCER1A', 'FCGR3A', 'n_counts', 'bulk_labels'], s=50, frameon=False, ncols=4, vmax='p99')

在此图中,我们可以看到表达标记基因的细胞组以及与原始细胞标签的一致性。
散点图的函数有很多选项,可以对图像进行微调。例如,我们可以按如下方式查看聚类:

本教程详细介绍了如何使用scanpy库进行Seurat单细胞转录组数据分析,包括UMAP和t-SNE的可视化,标记基因鉴定,以及聚类分析。文章使用了10x的PBMC数据集,并展示了如何通过不同类型的散点图和表达谱图来揭示细胞类型和基因表达模式。
——pythonscanpy&spm=1001.2101.3001.5002&articleId=130837563&d=1&t=3&u=d0e0a84d6c3849fb9edd6750436eac3e)
1379

被折叠的 条评论
为什么被折叠?



