做生物信息的朋友,谁还没被单细胞数据的“噪音”折磨过?以前搞bulk测序,差异分析也就是跑个DESeq2,P<0.05就行。现在玩单细胞,如果你还拿着那一套标准去geo分析单细胞测序差异基因,那基本就是在给自己挖坑。
上周帮一个临床医生客户看数据,他的肿瘤样本,聚类很完美,t-SNE图画得跟孔雀开屏似的。结果拿去做差异基因,一堆基因标红标绿,看着特别高大上。我让他去复核几个关键Marker,结果发现很多“显著差异”的基因,其实只是因为在某个簇里细胞数量太少,方差太大导致的假阳性。最后那个客户郁闷得三天没吃饭,说这数据发出去怕被审稿人喷死。
咱们今天就不整那些虚头巴脑的理论,直接上干货,聊聊怎么在海量数据里揪出真的差异基因。
第一,别迷信P值,要看FC(Fold Change)。在单细胞里,由于技术噪音(比如dropout效应),很多基因的表达量波动极大。我有个案例,一个免疫细胞簇里,某个干扰素基因P值低得可怜,但FC只有1.1倍。这种细微的差别,生物学意义真的那么大吗?未必。建议把阈值设得宽松点,比如Padj < 0.05 且 log2FC > 0.25 或者更高,具体看你样本的生物学背景。如果是做关键通路研究,FC至少要在1.5倍以上才稳妥。
第二,细胞纯度是王道。很多新手拿着raw count直接做分析,这是大忌。我在给一个高校课题组做咨询时发现,他们用的数据里混杂了少量红细胞和血小板,这部分垃圾数据如果不剔除,会严重干扰T细胞亚群的差异分析。记得用Scrublet或者DoubletFinder去双人检测,还有线粒体基因占比超过20%的细胞直接扔掉。只有把“杂质”过滤干净,后续的差异分析才靠谱。这一步做不好,后面花再多时间去geo分析单细胞测序差异基因都是白费力气。
第三,生物学重复不能少。这是最容易被忽略的。有些单细胞实验只做了一个样本分群,就想找差异。这种想法太天真了。个体差异远大于技术差异。如果你只有两个样本,其中一个样本里某类细胞多,那它和另一个样本的差异可能只是“运气好”,而不是“生物学特性”。正规的流程至少需要3个生物学独立重复,并且使用Mast或MAST-like模型来校正测序深度和批次效应。
再说个真实数据。我们处理过一批阿尔茨海默病的小鼠脑数据,常规方法筛出来几百个差异基因,但经过严格校正批次效应和细胞比例偏差后,真正稳健的差异基因只剩下20多个。但这20多个基因,直接指向了小胶质细胞的特定激活状态,这在之前的研究里根本没被重视。这就是深度分析的力量。
最后,可视化很重要。不要用那种密密麻麻的火山图糊弄自己。用VlnPlot看表达分布,用FeaturePlot看空间定位,用DotPlot看不同细胞类型的特异性。比如,当你发现一个新Marker,一定要看看它是不是只在你的目标细胞里高表达,在其他细胞里也有低水平的背景噪音。如果有背景噪音,那它可能不是特异性的,剔除它。
总之,做单细胞差异分析,心态要稳,手法要细。别急着发图,多问自己几个为什么:这个基因真的重要吗?这个差异是生物学原因还是技术噪音?只有经得起推敲的结果,才是好结果。希望大家在处理geo分析单细胞测序差异基因时,都能少掉几根头发,多出几篇高分文章。