上周项目 deadline 就在周五,我盯着屏幕上那堆杂乱的 shapefile 和 tiff,头疼得直揉太阳穴。找数据这活儿,真是越找越绝望。最后实在没办法,我就把“geo数据库”这几个词加上“百度网盘”扔进搜索框,没想到还真被我挖到宝了。
先说结论:别再去官网一个个下那些几百兆的压缩包了,太慢还容易断。我在一个老学长发在知乎的评论里,看到有人用 geo数据库百度网盘 分享了一些整合好的常用空间参考系文件和部分开源矢量数据。那个链接点进去,直接是分享码,输入后就能转存。这种操作现在很普遍,毕竟谁也不是全职下载员。
但是!大家千万记住,下载速度取决于你的会员等级,而且文件命名往往比较随意。我转存下来发现,里面混杂了好几个版本的 GeoJSON,还有一个明显没压缩的文件夹,光打开进度条都要看半天。那种烦躁感真的,差点想骂人。
重点来了,怎么用这些网盘里的数据。我习惯先建一个本地文件夹,结构得清晰。比如 geo_source/ 下面分 shp, tiff, json。从 geo数据库百度网盘 链接里把需要的文件拖下来,注意看文件头,如果是 .zip 压缩包里套 zip 那种俄罗斯套娃,记得先解压一层再移动。我昨天就犯了这个错,导致 GIS 软件识别不了坐标系,报错“CRS undefined”,折腾了半小时才发现是套娃。
还有一点很细节的地方,很多网传的 geo 数据其实是旧版的 WGS84 投影,直接拿来画中国地图会偏。这时候你得去查一下文件的投影信息。我是在 QGIS 里双击图层,看坐标参考系,确认是 EPSG:4326 还是 EPSG:4547。如果发现不对,就在项目属性里重新定义。别嫌麻烦,这步省了后面全是泪。
另外,网盘里的文件有时候会被和谐或者损坏。我下载的一个土地利用分类 tiff 图,打开全是紫红色,典型的元数据丢失或者波段顺序错误。后来我在网上搜了一圈,发现只要用 Python 的 rasterio 库重新读取一下,指定波段顺序,就能修好。代码也就两三行,但要是不知道这个技巧,你可能就得重新去 geo数据库百度网盘 里找个更干净的备份。
说到备份,强烈建议大家养成习惯。核心数据一定要同步到另一个云盘或者本地硬盘。网盘这东西,虽然方便,但毕竟存在被吞文件或者链接失效的风险。我之前存的一个 5GB 的水系数据,上周突然打不开,显示文件不存在,心态直接崩了。还好我之前本地有备份,不然又要从头找。
最后给几个实在的建议。如果你只是做演示,找个轻量级的 geo 数据就够别贪大求全。如果是做严肃研究,尽量去官方数据源,比如国家地理信息公共服务平台,虽然下载慢点,但数据权威。对于学生党或者初级从业者,利用 geo数据库百度网盘 这种资源池可以快速起步,但一定要学会清洗数据。
遇到问题别死磕,多在技术论坛问问。数据这东西,源头很重要,但处理过程更重要。你要是也有好用的数据源分享,或者遇到了什么奇葩的数据坑,欢迎在评论区交流。咱们互相提个醒,少踩点雷。