本文关键词:geo数据挖掘表达量数据库
你想搞生信但又不想从头搭环境?
Geo数据挖掘表达量数据库 就是你的救命稻草。
直接拿走现成数据做分析 省时省力还不容易报错。
说真的
刚开始接触这块的时候 我也懵过。
觉得那些序列号啊 GSE啥的 跟天书一样。
其实核心逻辑特别简单。
GEO就是NCBI那个 把全世界科研做出来的芯片和测序数据都扔里面的地方。
你不用自己做实验 只要找到对应的那条数据
就能跑差异表达 做聚类 画火山图。
但是啊
直接下载个txt文件就开始跑 R语言一打开就报错的 大有人在。
为什么 因为数据没处理好。
GEO数据挖掘表达量数据库 里的原始数据 Raw Data 通常是不能直接用的。
特别是那些芯片数据 背景校正啊 归一化 这些步骤要是没做
后面的结果全是胡扯。
我之前就栽过跟头
花了一整天调参数 最后发现原始值没去探针ID对应的基因名
整了个寂寞。
这里必须强调一点
RPM、CPM、FPKM、TPM 这些单位 千万不能混着用。
如果你想做差异分析
最好用经过标准化处理后的表达矩阵。
GEO数据挖掘表达量数据库 里有些文章作者很贴心
会提供 Series Matrix File
这文件里通常有处理好的数据
省去了你自己跑Limma或者DESeq2做预处理的麻烦。
怎么找靠谱的数据呢
别光看GSE开头的号
一定要看GDS里的样本描述。
看看是不是你感兴趣的组织
正常组有没有病
处理组是什么干预手段。
这里有个坑 很多老数据的平台注释很烂
探针ID到Ensembl Gene ID的映射关系缺失特别多。
用BiomaRT去映射的时候
掉掉几十个甚至上百个基因 根本没法发文章。
所以选数据时 一定要看平台是不是最新的
或者是大家都常用的Affymetrix或者Illumina芯片。
还有一点很多人忽略
就是样本量。
GEO数据挖掘表达量数据库 里有些数据集只有三四个样本
这种数据做出来的结果 统计效力极弱
除非你只是做个预实验
不然真不推荐用。
尽量找样本量在20例以上的
特别是正常组和疾病组平衡的。
这样你做出来的PCA图才会分开得漂亮
审稿人才不会刁难你。
至于工具
如果是新手 强烈建议用R的tidyverse系列包
或者直接用GEO2R在线工具试跑一下
感受一下数据长啥样。
如果非要硬学
SVA包处理批次效应 是必经之路。
因为不同批次、不同操作员的芯片数据
背景噪音差异巨大。
不校正的话 你的差异基因里 一半都是噪音基因。
这点太重要了 我在实验室看到太多人因为没做SVA
最后结论被推翻的例子。
对了
下载数据时 注意文件大小
有的老数据压缩包几十兆
解压出来几百兆的Excel
直接卡死电脑。
建议直接用R的read.delim函数
一行行读 别全加载到内存里。
总结下来
GEO数据挖掘表达量数据库 入门不难 难在细节。
选数据要谨慎
预处理要到位
统计方法要对路。
别以为下了个数据 套个模板就能出结果
科学这事 容不得半点马虎。
你要是能把前三个坑避开
你的第一篇生信文章 基本就稳了一半。】