ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

GEO数据库包含哪些数据信息?别被营销号忽悠,这几点最坑

GEO数据库包含哪些数据信息?别被营销号忽悠,这几点最坑

说实话 刚开始接触生物信息学的时候 我也被GEO这堆缩写搞晕了。到底GEO数据库包含哪些数据信息 才是咱们真正用得上的?

先说个大实话 很多人以为GEO里全是测序的原始数据。那是大错特错。我去NCBI翻资料的时候 发现其实GEO的核心就是SRA和SRA子项目。

你去看NCBI的官方文档 上面写得挺清楚。但官方文档太干了 看着头疼。我给大家拆解一下 咱们做课题 真正能捞到金子的是哪几块。

第一块 也是最基础的 是实验元数据。

这就好比你去饭店 菜单上写的是什么 谁点的 什么时候点的。在GEO里 这就对应着GEO的Series(GSE)和Sample(GSM)信息。

你搜一个GSE号 进去看Supplementary data那一栏。

这里存的是表格 通常是TXT格式。

里面的列名你得仔细看。有的写的是"Control" "Treat" 有的直接写"Sample1" "Sample2"。

我上次帮一个研究生整理数据 他非要用Excel打开那个TXT文件。结果乱码一堆。

其实应该用专门的解析工具或者R语言脚本。

这点很关键 别在数据清洗这种基础环节浪费太多时间。

第二块 是矩阵文件。

这才是硬核内容。

如果是表达芯片芯片(RNA-seq或者Microarray) 这里存的通常是标准化的表达量矩阵。

比如TPM FPKM或者Log2-transformed counts。

注意啊 不同文章的归一化方法不一样。

我看过两篇顶刊的文章 用的同一批GEO数据。

一篇用的是DESeq2归一化 另一篇用的是edgeR。

最后跑出来的差异基因 差别居然有将近20%。

这就是为什么我建议你 尽量去下载原始的FASTQ文件自己跑流程。

除非你的课题特别简单 不然直接用别人的矩阵 风险很大。

第三块 常被忽略的 是注释信息。

GEO里的注释(Annotated)不是自动准确的。

NCBI提供了一套自动注释体系 但经常有滞后性或者错误。

特别是那些新转录组 或者非模式生物。

比如我做肠道微生物组分析的时候 发现GEO里的物种注释 和我用MGnify跑出来的 重合度只有60%。

剩下的40%是GEO标错了 还是MGnify错了?

这就需要我们自己去比对了。

别信GEO的默认注释 一定要拿自己的数据库去重跑一遍。

再说个避坑点。

很多人只看GSE号 不看版本号。

GEO的数据是会更新的。

我遇到过一次 我三年前下的一个数据集 和今年下的 表达量数值不一样。

因为作者后来修正了质控标准 重新提交了数据。

所以 如果你要复现老文章的结论 一定要确认你下载的数据版本 和文章发表时引用的是否一致。

在GEO的Series页面 有个Revision history 一定得点开看看。

最后 关于GEO数据库包含哪些数据信息 到底有没有"隐藏"的东西?

其实没有。

GEO就是个仓库。

它存的是公开的数据 以及作者上传时选择的文件。

有些作者很懒 只传了个PDF的补充材料 矩阵文件都没传。

这种GSE号基本就是废的。

你搜数据的时候 先看Supplementary data里有没有TXT或CSV格式的矩阵文件。

如果没有 建议直接换下一个数据集。

别浪费时间在那猜数据长啥样了。

写这篇东西的时候 我还在想 为啥那么多教程 都在讲怎么用R包做分析 却没人讲讲数据本身长啥样。

结果就是 很多人代码写得挺漂亮 但数据是错的。

这就好比用漏勺做饭 火开得再猛也没用。

GEO数据库包含哪些数据信息 这个看似基础的问题 其实是很多生信分析的起点。

起点错了 后面全白搭。

希望这些大白话 能帮到你。

尤其是那些刚入坑的萌新 别被那些花里胡哨的可视化图迷了眼。

先把数据搞清楚 比啥都强。

对了 如果你发现自己下载的数据 行数对不上 列名奇怪。

先检查文件编码 是不是GBK或者UTF-8搞混了。

这个低级错误 我也犯过 别丢人。

返回列表