最近帮师弟调数据,发现好多人卡在GEO这步。
其实下载geo数据库单细胞数据免费,真没那么玄乎。
我就说下我摸爬滚打几年的经验。
首先别被网站界面劝退。
GEO界面确实老旧,但数据是真的香。
尤其是单细胞测序,这几年爆发力太猛了。
很多发在Nature子刊上的原始数据都在这儿。
很多人第一步就错,直接点Download。
结果下了个txt,打开全是乱码。
单细胞数据不像普通芯片,结构很复杂。
你需要的是矩阵文件,或者是h5文件。
这里有个坑,很多人没注意。
GEO里搜GSM或GPL编号。
单细胞数据通常以Raw Counts形式存在。
你要找的是Matrix表,而不是简单的表达谱。
比如搜“single cell RNA seq”,筛选Platform。
找到数据了,怎么下?
鼠标右键,复制链接地址。
别直接点那个破按钮,容易中断。
打开命令行,用curl命令去抓。
加上参数-fL,自动跳转和失败提示。
比如:curl -fL -o data.tar.gz [你的链接]
这样下载速度快,还能断点续传。
如果文件特别大,建议用wget。
参数加-c,支持断点续传,很稳。
下完文件后,解压是个问题。
很多文件是.tar.gz或者.tar.bz2。
Windows自带解压搞不定,请用7-zip。
一定要看清楚后缀,别强行解压。
解出来是一堆txt,还是压缩包?
如果是压缩包,记得再解一层,别问我怎么知道的。
最关键的一步来了。
文件格式转换。
GEO给的往往是宽格式,或者是稀疏矩阵。
直接用R语言读取可能报错。
建议先看一下series matrix。
里面会有描述,告诉你文件长什么样。
如果是10x Genomics的数据,通常会给fastq。
这时候你得先比对,生成counts。
如果你只要表达量,找“count matrix”。
有时候研究者会提供整理好的csv。
这时候直接用read.csv读就行。
还有一种情况,数据是以h5格式存的。
比如Seurat包直接处理的格式。
这种文件GEO上也有,叫.h5ad或者.h5。
下载下来用Python的scanpy加载。
pd.read_hdf或者sc.read_h5ad。
直接就是AnnData对象,特别方便。
这里对比一下,直接下fastq vs 下矩阵。
下fastq适合想重新跑流程的人。
下矩阵适合快速复现和分析。
对于90%的需求,下矩阵就足够了。
除非你要检查原始质量,才用fastq。
另外,注意样本的配对信息。
在GEO的Sample table里找。
把文件名和样本ID对应起来。
不然分析时,批次效应混在一起,没法看。
一定要建一个映射表,Excel搞定。
还有个细节,缺失值处理。
单细胞数据天生就有dropout。
下载的raw count里,大量0是正常的。
别当成错误删掉,那是生物学特性。
但在质控前,最好看看低质量细胞多不多。
我见过最无语的操作,是把所有文件混在一起解压。
目录全乱了,找都找不到。
建议建好文件夹,按Sample ID命名。
下载前规划好,能省一半时间。
至于权限,部分数据可能有Accession Code要求。
如果是公开数据,直接下即可。
如果需要登录,用NCBI账号。
大部分单细胞数据现在是公开的。
不用填一堆复杂的申请表,直接抓。
总结下步骤:
1. 登录NCBI,搜GEO。
2. 确认数据是Raw Counts或Fastq。
3. 复制文件URL,用curl或wget下载。
4. 本地解压,区分批次和样本。
5. 用R或Python加载,开始分析。
这个过程虽然繁琐,但比买数据强太多了。
数据免费,但你的时间值钱。
熟练之后,半小时搞定一个数据集。
赶紧去练练手吧,早用早享受。
本文关键词:geo数据库下载单细胞数据免费