ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

GEO一样本单细胞基因表达量分析翻车实录:那些坑你踩了几个?

GEO一样本单细胞基因表达量分析翻车实录:那些坑你踩了几个?

本文关键词:GEO一样本单细胞基因表达量

昨晚熬到三点半,盯着屏幕上的UMAP图发呆,突然觉得单细胞测序这东西,真是“看着美,干着累”。

起因是我在GEO里扒拉了一个比较老的小鼠脑区数据集(GSE113215,虽然挺经典但预处理参差不齐)。我原本想做个简单的GEO一样本单细胞基因表达量对比,看看不同发育阶段的神经元差异。结果一跑下来,背景噪声大得离谱,细胞好像散成了一锅粥。

这就得聊聊我在处理这类数据时踩过的几个大坑。很多新手朋友拿到GEO的矩阵文件,直接开降维,这是不对的。GEO上很多作者上传的是经过简单过滤后的counts,但有些是log normalized后的值,甚至有的还带了UMAP坐标(千万别直接用那个坐标,维度太低全是信息损失)。

我这次就是栽在这上面。我直接用了上传的normalized matrix,没检查原始UMI计数范围,导致后期做差异基因分析时,很多低表达基因根本没被检测到。后来我去翻了原文的Supplementary Info,发现作者只保留了高置信度的细胞,而且他们的质控标准比我严得多。

重新回到Raw Counts,重新做QC。

过滤掉高线粒体基因(>20%)和低检出基因数的细胞。这一步很关键,尤其是对于GEO一样本单细胞基因表达量分析来说,数据源差异太大,质控必须严格。我大概扔掉了15%左右的细胞,心里肉疼但没办法,质量第一嘛。

接下来是去批次效应。虽然这次只有一个样本,但为了后续可能与其他样本合并,我还是跑了Harmony。效果确实好了一些,原本纠缠在一起的几个星形胶质细胞簇分开了一些。但是!我要强调一点,别迷信自动化注释工具。CellTypist或者scVI跑出来的注释,看着挺专业,但你得自己去查marker基因。比如我有个簇被标成了“Oligodendrocyte Precursor”,但我看了一下Caspase4和Gpx2的表达,怎么越看越像小胶质细胞?最后我手动改了注释,果然,那确实是应激状态下的Glia。

这里有个小案例:我同事上周处理人的肺部数据,直接用了默认的聚类分辨率。结果把两种不同的T细胞亚群混在一起了,因为他们表面的激活标志物(如Cd69, Ctla4)在低分辨率下没分开。最后只能手动把分辨率调到1.5或者更高,配合leiden聚类,才把它们拆开。

还有那个让我头疼的Doublet。很多教程说用DoubletFinder,但那个参数调参简直让人头秃。我后来直接用了scDblFinder的默认值,再配合检查高基因表达量(通常doublet会表达更多基因)和双阳性细胞比例,手动筛掉了一批。虽然不完美,但比全自动可靠。

最后说说可视化。很多人喜欢堆砌颜色,把每个细胞类型画得五颜六色,看着像万花筒。其实,如果你要讲GEO一样本单细胞基因表达量的故事,不如画几个关键marker的空间分布图,或者做个Feature Plot对比不同条件下某个通路(比如炎症通路)的平均表达量。这样更有说服力。

对了,别忘了检查你的细胞类型比例是否符合生物学预期。如果一个样本里神经元占了90%,而你研究的是胶质瘤,那大概率是数据有问题,或者肿瘤细胞被当成“杂细胞”滤掉了。我当时就遇到了这种情况,原本以为滤掉的“low quality”细胞,仔细看其实是一些低表达但典型的肿瘤细胞。幸好我留了备份,重新调整过滤阈值后,那些细胞又回来了。

数据这东西,真的是三分靠跑,七分靠懂。GEO一样本单细胞基因表达量挖掘不是个技术活,更是个侦探活。你得了解你的生物学背景,知道什么信号该留,什么噪声该扔。

别总想着一步到位搞个大新闻,先把每一步的逻辑理清楚。哪怕最后发现没有显著差异,那也是排除了一个假设,对吧?

希望各位小伙伴在GEO的坑里少摔几跤。毕竟,头发就那么多,经不起这么造。

(注:文中提到的具体数值如15%、>20%等为经验值,具体阈值建议根据实验体系微调,参考文献建议结合Seurat官方指南及近期高分文章如Cell中关于scRNA-seq标准方法的论述)

返回列表