做生信分析,90的人都在问这个。搞混这两个数据库,项目直接废掉。
读完这篇,你再也不怕搞砸数据收集。
我见过太多新手,把TCGA当公共数据狂下。结果发现根本没法做差异分析。
因为TCGA没有配对临床信息时,很多样本是匹配的。但GEO里大多是独立样本。
这就是geo和tcga有什么区别的核心。不懂这点,你只能在那边哭。
我先说结论。
TCGA是癌症全景图,GEO是散落的宝石。
TCGA的数据质量高,但是只针对特定癌症。
它的样本量很大,通常有几千个。但仅限于那几种高发癌种。
比如肺癌、胃癌、乳腺癌。如果你想找罕见病,去TCGA就是浪费时间。
这时候就得看GEO。
GEO就像个杂货铺,什么都有。
但是问题也大,数据格式乱七八糟。
有些数据集连预处理都没做,直接给你原始矩阵。
这时候就要小心了,如果你不知道geo和tcga有什么区别,很容易踩雷。
比如上次有个学生,下了GEO数据就直接跑差异分析。
结果P值全是0.05以上。
后来我发现,他忘了去除批次效应。
GEO的数据来自世界各地,不同实验室用的芯片不一样。
有的用Illumia,有的用Affymetrix。
这导致数据之间偏差巨大。不处理的话,结论全错。
再说个真金白银的坑。
很多人觉得TCGA是免费的。
确实免费,但是数据获取流程繁琐。
你需要向dbGap申请权限。
这个过程可能要等一两个月。
而且有些数据只能本地下载,不能随意共享。
如果你急着出文章,这种等待真的让人崩溃。
反观GEO,大部分数据点一下鼠标就能下。
速度极快,方便测试代码。
但是,GEO的临床信息往往不全。
有的数据集只给了一行简单的描述。
性别、年龄、生存期这些关键信息,可能缺失了一半。
这就导致后续生存分析很难做。
所以,怎么选择很重要。
如果你的课题是找通用的分子机制。
TCGA更靠谱,因为注释全,配套工具多。
现在有很多现成的R包,一键就能分析。
但如果你研究的是特定条件下的基因表达。
比如某种药物处理前后的变化。
TCGA里可能根本没有这类数据。
这时候GEO就是唯一选择。
不过用GEO前,一定要仔细筛选数据集。
看样本量是不是太小。
看有没有重复的配对样本。
我之前遇到过,一个GEO数据集声称有100个样本。
结果仔细看meta数据,只有50个。
另外一半是质量控制被剔除的。
这种细节不注意,结果肯定不严谨。
还有一个常见的错误。
把不同平台的数据直接合并。
比如把HGU133A芯片和RNA-seq混在一起跑。
这是绝对不行的。
技术平台不同,数值分布完全不同。
强行合并只会得到一堆垃圾数据。
除非你会做复杂的Batch Correction。
否则别尝试。
最后说说怎么省钱省时间。
如果你只是初学者,想练手。
先用TCGA。
数据干净,文档齐全。
哪怕复制粘贴代码,也能跑通。
等你熟练了,再挑战GEO。
学会怎么清洗那些脏数据。
这才是高手的标志。
切记,不要用geo和tcga有什么区别来逃避学习。
这是你需要掌握的基本功。
不然以后导师问起来,你支支吾吾说不清楚。
那才叫丢脸。
现在知道怎么选了么?
如果还有疑问。
或者手里有一堆GEO数据不知道怎么清洗。
可以私信我。
我帮你看看数据质量。
毕竟,数据不对,努力白费。