做生信的朋友都知道 搞geo数据库拷贝数分析这玩意儿,真不是光跑几个脚本就能完事的。去年带实习生跑数据 踩了无数坑,今天把这些干货掰开了揉碎了讲给你听。很多人第一步就错了,上来就对着表达矩阵搞 其实拷贝数变异常(CNV)跟基因表达量完全是两码事。你要真想入门geo数据库拷贝数分析 首先得把GEO平台上那些原始数据扒下来 别偷懒只用Processed Matrix 因为那个矩阵往往丢了很多低丰度的变异信息。我通常建议直接下Raw Data 特别是芯片数据,得看Cel文件。
说到工具 现在主流的有几款。GISTIC 2.0 算是老牌的,但是对输入数据格式挑剔得厉害,而且跑一次得等半天。还有CNVnexus,这个我比较推荐 特别是处理SNP芯片数据的时候,它的稳健性比那些基于表达量的估算方法强太多。别不信,上个月我对比了同一组肺腺癌样本,用表达量推导出来的CNV和实际测序结果对,重合度只有60%左右;换成专门的拷贝数算法,重合度直接拉到85%以上。这中间的差距 就决定了你的文章能不能发出去。
这里必须提一个血泪教训:归一化!做geo数据库拷贝数分析 最容易翻车的地方就是没做好样本间的归一化。比如不同批次的芯片,背景噪声都不一样,你要是不先做RMA或者GCRMA标准化 直接拿原始探针强度去跑CNV 那出来的噪声比信号还大。我见过有人直接把所有样本堆一起分析,结果分箱后全是假阳性。正确做法是先分批次做QC 把pvalue > 0.5的那些样本剔掉。对了,有个新手问我怎么确定cut-off值,其实没必要纠结固定的logR阈值,最好结合样本自身的分布情况动态调整。我们组一般是用Median polish之后的LogR值 以0为中轴 前后扩展1.5倍中位数绝对偏差作为阈值,这样更稳。
还有个大坑是探针的映射。GEO里的探针 ID 很多时候对应不到最新的GENCODE注解。你得先拿RefSeq ID去查,再映射到GENCODE的Gene ID。这一步要是漏了 后面关联功能分析的时候,好多基因就找不到了。我一般是用biomart批量抓一次 确保映射准确率在90%以上。如果映射不上 别硬凑,直接丢弃,数据完整性比数量重要。
至于结果解读 千万别只盯着显著的CNV区域看。有时候一个区域虽然统计上不显著,但在生物学功能上很关键。这时候就得结合肿瘤类型文献 看看有没有已知的驱动基因。另外,记得画个Heatmap出来 不仅要看体细胞CNV 还要区分一下胚系和体细胞。虽然大部分CNV分析默认是体细胞,但在GEO数据库里 混着正常样本和数据污染的情况挺常见的。如果不做纯度校正 估计出来的Allele Frequency全是扯淡。
最后总结一下 做geo数据库拷贝数分析 核心就三点:原始数据质量、合适的算法选择、严谨的QC流程。别指望一键出结果,这活儿得耐下心来一步步调参数。工具只是个手段 理解背后的生物学意义才是根本。希望这些经验能帮你在数据处理少走点弯路。对了 如果你做的是Tumor-Adjacent Normal配对样本 一定要用配对设计的算法 比如DNAcopy里的方法 单独分析Tumor会丢掉很多低频变异信息。
本文关键词:geo数据库拷贝数分析