本文关键词:GEO数据做免疫细胞浸润分析
说句掏心窝子的话,现在手里攥着GEO数据做免疫细胞浸润分析,真的是把双刃剑。很多人刚入门,拿着CIBERSORT或者xCell跑出一堆漂亮的热图,发在公众号里看着挺唬人,真到了审稿人或者大拿手里,直接被问得哑口无言。我就见过太多同行,把方法当神棍拜,数据一出来就觉得自己掌握了真理,其实呢?那不过是一堆算法拟合出来的噪音而已。
我之前带过一个小师弟,刚接触这行,对GEO数据做免疫细胞浸润分析特别痴迷。他拿了个肺癌的数据集(好像是GSE29122),直接用默认的CIBERSORT算法去跑,出来的结果CD8+ T细胞在癌组织中浸润极低。他特别激动,觉得这是个巨大的阴性发现。我让他仔细看看原始数据里的read counts分布,还有批次效应。后来才发现,他预处理的时候根本没把平台差异去掉,RNA-seq的数据直接跟microarray混在一起跑了,这纯属是关公战秦琼。最后老老实实回去做limma-voom校正,结果反过来了,免疫浸润其实挺高的,只是因为高表达基因主导了聚类特征导致算法误判。这种事在圈子里太常见了,大家总觉得GEO数据是现成的馅饼,咬一口发现是石头。
现在的风向其实变了,以前大家迷信deconvolution算法,觉得CIBERSORT是爹,ESTIMATE是妈。但到了2024年,你要是还没听说过scRNA-seq辅助的bulk浸润分析,或者单细胞聚类后的反卷积,那你可能有点out了。有个组去年发了篇挺火的子刊,他们就没用传统的marker gene set,而是先用单细胞数据鉴定出特有的免疫亚群,构建signature后再去预测bulk数据里的比例。这种方法在GEO数据做免疫细胞浸润分析中,准确性比传统方法高了大概两个量级,尤其是那些肿瘤特异性抗原相关的T细胞群体,传统方法根本抓不住。
这里得提一嘴避坑。千万别为了追求P值显著,反复挑选算法直到跑出来“好看”的结果。我有个朋友,换了七八种算法,ssGSEA、TIMER、MCP-counter全用了一遍,挑了个CD4+ T最显著的那张图投出去,被拒信上写得明明白白:“Statistical bias in deconvolution selection”。太扎心了。其实GEO数据做免疫细胞浸润分析最核心的不是算法有多新,而是你得有生物学验证。哪怕你只做了一百例临床样本的免疫组化(IHC)或者多重荧光(mIHC),跟你的预测结果做个Spearman相关系数,那比跑一百个虚拟算法都顶用。
还有一点,很多人忽略GEO数据的来源背景。GEO上很多老数据,比如2008、2009年的,那是Affymetrix GeneChip 1.0或2.0平台,基因探针的覆盖度跟现在Illumina的NGS完全不是一个概念。你要是拿这些老数据跟最新的高深度测序数据去比较免疫微环境的异质性,简直就是拿着竹竿量天。我在处理一个乳腺癌队列时就踩过这个坑,早期数据里很多低频转录本根本检测不到,导致NK细胞的比例被严重低估。后来我筛选数据,只保留了TPM>1或者raw count>10的基因做下游分析,结果才稳了一点。
至于工具选择,现在R环境里immunedeconv包挺好用,集成了七八种方法。但我个人建议,别贪多。选一种主流的方法(比如CIBERSORTx),重点放在参数设置和显著性检验上。特别是p-value的校正,多重检验校正一定要做,别用Bonferroni那种太保守的,FDR更合适些。另外,别忘了检查immune score的整体趋势,单看某一种细胞类型容易以偏概全。
写到这里,突然觉得科研这事儿,真没法走捷径。GEO数据做免疫细胞浸润分析也不是什么灵丹妙药,它只是我们窥探肿瘤微环境的一扇窗。窗子擦得干净点(预处理规范),玻璃材质选对点(算法匹配),再加上实地验证(湿实验),看到的风景才真实。别被那些花里胡哨的heatmap迷了眼,归根结底,还是要回答生物学问题。你要是连样本是不是肿瘤、分期是几、用药历史都没搞清就上去跑算法,那做出来的东西,也就只配在预印本上吃灰了。
最后唠叨一句,保持谦卑。数据永远在更新,方法永远在迭代。昨天觉得神似的算法,今天可能就被打脸。多看看原文,多跟搞临床的同事聊聊,听听他们切片底下看东西的感觉,比你在电脑前盯着数字跳动要靠谱得多。