想查非肿瘤病的基因变异数据?别在NCBI上瞎找了。
Geo数据库里其实藏着不少“宝藏”。
尤其是那些冷门遗传病的临床样本,比你想的多得多。
很多人以为Geo(Gene Expression Omnibus)只是查肿瘤组学的。
这是个巨大的误解。
我去年带组里两个研究生做先天性耳聋项目,就踩了坑。
一开始他们死磕肿瘤数据库,查了半个月没结果,差点怀疑人生。
后来我让他们去Geo的高级搜索里,把物种限定为Homo sapiens,再看平台类型。
奇迹出现了。
大量非肿瘤疾病的数据,就静静躺在那里,没人认领。
Geo数据库包含哪些非肿瘤疾病呢?我给你扒一下底牌。
首先是单基因遗传病。
比如囊性纤维化,地中海贫血,还有罕见的线粒体病。
我翻了一个GSE编号,是2021年上传的。
样本只有12例,全是儿科病房直接送检的血样。
虽然量小,但纯度极高,全是确诊患者。
这种数据在商业数据库里根本买不到。
价格能便宜十倍,还得自己去清洗。
第二个大类是自身免疫性疾病。
系统性红斑狼疮,类风湿关节炎。
很多人做机制研究时,找不到的对照,最后都在Geo里挖到了。
有个同行跟我吐槽,他说找肝豆状核变性的RNA-seq数据,找了半年。
最后在一个不起眼的GEO条目里,找到了一个德国团队传的数据。
虽然测序深度只有30M,但足够他们做差异表达分析。
这就是真实案例。
Geo数据库包含哪些非肿瘤疾病,其实还有一大类:感染性疾病。
特别是那些病毒性肝炎的恢复期数据。
以及HIV感染者与未感染者的对比。
这类数据更新很快。
2023年到2024年,上传量激增。
因为很多医院现在开始常规测序,然后顺手传到公共库。
但注意,这里有个大坑,千万别忽视。
不是所有标注为非肿瘤的数据,都真的跟肿瘤无关。
我之前看过一个标注为“哮喘”的GEO项目。
下载下来一分析,发现混进去了两例肺癌早期筛查的样本。
原因?实验人员搞混了条码,或者样本污染。
这就是为什么你要看SRA原始数据,而不是直接信Metadata。
Geo数据库包含哪些非肿瘤疾病,这个长尾词搜索量不高,但精准度极高。
搜索它的人,通常是带着具体问题来的。
他们需要的不是教科书式的答案。
而是能落地的资源路径。
还有一点,很多小众疾病的数据,是分散的。
比如某种肌病,可能在美国有一个小样本,在日本有另一个小样本。
你得把这两个GEO编号合起来,才能凑够统计学效力。
这就是手动整合的痛苦所在。
我用的是R语言,写了个小脚本自动抓取下载。
省了至少一周时间。
另外,BioSample链接一定要点进去看。
很多作者懒得填详细表型。
你得去查原始论文,甚至发邮件问作者要详细表型。
这个过程很烦,但必须做。
数据质量,决定了你后面半年的方向。
别图省事,直接拿别人的分析结果。
那是死路一条。
Geo数据库里这些非肿瘤数据,往往是“毛坯房”。
你需要自己装修。
但这正是科研的乐趣所在。
你发现的每个数据点,都可能成为新发现的起点。
别被名字骗了,也别被数据库的界面吓倒。
多花点时间搜索,你会发现,世界比你想象的丰富得多。
哪怕只有十个样本,只要干净,就是金子。
现在就开始搜吧。
别等别人把坑踩完了,你再去交学费。