ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

死磕geo多个芯片结果 tcga数据融合时的的那些坑和捷径

死磕geo多个芯片结果 tcga数据融合时的的那些坑和捷径

搞生物信息分析的朋友应该都懂。拿数据像开盲盒。有时候为了凑样本量不得不去下载GEO的原始数据。有时候又不得不去扒TCGA这种超级大盘子。最痛苦的就是要把这两类截然不同的数据捏在一起。做交集或者比较。你以为是黄金搭档。实际可能是灾难现场。

我前阵子接了个活。客户非要用GEO里三个独立的乳腺癌芯片数据和TCGA的RNA-seq数据一起跑差异表达。说是为了验证某个标志物。我拿到数据后心里咯噔一下。GEO是microarray。TCGA是NGS。这俩根本就不是一个量级的东西。直接拿原始count值或者FPKM去比?那是外行干的事。

很多人第一步就错了。想着把GEO的下完。做个RMA标准化。TCGA的下完。做TPM标准化。然后直接把两组数据拼起来。跑个PCA看看聚类。结果一看。好的。两组数据隔得十万八千里。基因相关性几乎为零。这时候再去做交集找共同差异基因。基本上啥也找不出来。或者说找出来的全是噪音。

这就涉及到一个很核心的问题。批次效应。虽然大家都说消除批次效应。但跨平台的技术平台差异。比批次效应难搞得多。GEO里的芯片。不同的探针。不同的厂家。甚至不同的年份处理的样本。背景噪声完全不同。而TCGA的数据。虽然也是混杂的。但至少测序平台相对统一。

真正能用的办法。不是强行合并。而是寻找重叠的特征。比如。你先在TCGA里。把肿瘤和正常组织比一遍。筛出500个核心差异基因。然后把这500个基因。去GEO的那几个芯片里。看他们的表达趋势是否一致。注意。不是看绝对表达量。是看趋势。看折叠变化方向是否对得上市。

举个例子。有个标志物GeneX。在TCGA里肿瘤高表达。在GEO的几个数据集里。也要高表达。这才叫可靠。如果GEO里忽高忽低。那这个基因多半是过拟合了某个特定的批次。

还有一类人是先合并再分析。强行把GEO数据转换。比如用WGCNA的超级整合方法。把不同平台的基因表达值映射到Z分数上。这在逻辑上说得通。但在实际操作中。容易丢失生物学变异。因为标准化会把每个基因都变成平均值0标准差1。那样你还能看出谁高谁低吗?只能看出相对排名。这时候。如果你去做生存分析。p值可能很好看。但生物学意义就虚了。

我之前处理过一个肺癌的数据。GEO里只有10个样本。TCGA有500多个。为了增加GEO样本的代表性。我把TCGA里那些和GEO队列临床特征最相似的10个TCGA样本。强行凑成一个小的“合成队列”。然后用这个合成队列去和GEO数据做meta分析。这种方法虽然被一些硬核生信大佬嗤之以鼻。但在临床验证上。 surprisingly effective。因为它利用了TCGA的海量背景信息来校正GEO的小样本偏差。

这里有个细节。选TCGA样本的时候。一定要看亚型。不能随便选。必须确保TCGA选出来的10个人。和GEO里的10个人。分型一致。比如都是三阴性乳腺癌。或者是肺腺癌。不然就是关公战秦琼。没法学。

还有。很多新手忽略了一个点。样本量。GEO的单个芯片数据。样本量太小。统计效力不足。单独看很容易假阳性。所以。最好把GEO里同一下载批次的所有可用芯片。尽可能合并。哪怕用ComBat校正一下批次。也比单独看一个强。当然。合并前一定要检查样本的临床信息是否齐全。缺失关键信息如生存时间的样本。最好剔除。否则后续生存曲线跑出来也是垃圾。

别嫌麻烦。生物信息的魅力就在这儿。不是在跑代码。而是在理解数据背后的生物学逻辑。geo多个芯片结果 tcga数据的结合。不是为了凑文章里的图好看。而是为了证明这个发现足够稳健。经得起不同技术平台的验证。

最后提醒一句。别迷信p值。在数据合并的情况下。多重检验校正一定要严格。False discovery rate控制在0.05以下都嫌松。建议0.01。毕竟我们要的是真相。不是巧合。做科研嘛。真诚面对数据。比什么都重要。别为了发文章去操纵数据。读者和审稿人。迟早会发现你在那儿瞎扯。

返回列表