本文关键词:geo数据中对照组提取
做GIS或者遥感数据分析的兄弟都知道,geo数据中对照组提取这一步,看着简单,实操起来能让人怀疑人生。特别是当你想做一个严谨的对比分析,比如研究某种土地利用变化对局部微气候的影响,或者验证某个地理模型的精度时,对照组选得不对,后面所有的模型跑出来都是废纸。
我上周接手一个项目,甲方要分析某城市新区建设与老城区的噪音差异。刚开始我图省事,直接按行政区划拉了个框,结果发现新区里混进了几个大型工地,老城区里又有几个医院和机场周边,数据一跑,方差大得离谱。这就引出了第一个问题:随机性还是分层?很多新手会直接用随机采样,觉得这样最“客观”。但在地理数据里,空间自相关性是躲不掉的。你随机点的两个点,可能离得特别近,导致样本冗余,也可能离得十万八千里,完全不在同一气候带。这时候,你得考虑分层随机抽样,或者基于空间网格来取点。我的经验是,先按地形、土地覆盖类型分层,然后在每一层里做geo数据中对照组提取。这样出来的样本,分布才均匀,统计显著性才靠得住。
第二个坑,也是我最容易犯的,就是“可及性”陷阱。做环境评估或者社会学调查时,对照组得考虑研究者能不能真的到达那里。比如你要对比山区和河谷的植被健康,你选的对照组点如果都在悬崖边上,无人机飞不过去,地面调查又走不到,那这组数据最后只能靠插值猜。猜出来的东西,拿出去发论文或者汇报,稍微内行点的人一眼就能看出来。所以,在提取阶段,一定要结合路网或者DEM数字高程模型,做一个可达性掩膜。把那些理论上能选,但实际上数据采集难度极高的点给剔除掉。这不是作弊,这是务实。我后来调整了筛选条件,只保留道路500米范围内且坡度小于15度的点,虽然样本量少了20%,但数据的真实度和一致性反而提高了不少。
还有个容易被忽视的细节,时间窗口得咬死。Geo数据很多时候是多时相的。你的实验组是2020年6月的Landsat影像,对照组如果不小心混进了2020年9月的Sentinel-2,那云影、植被物候期的不同,会让你误以为是选址问题,其实纯粹是时间没对齐。我有个同事就这么坑过,最后查了三天才发现是传感器类型混用了,波段响应函数不一样,归一化植被指数算出来自然对不上。所以在做geo数据中对照组提取时,建议先在一个元数据文件里把影像日期、卫星平台、大气校正参数全部锁定一致,再去做空间筛选。
最后说说工具。用ArcGIS的Create Random Points工具其实就够了,不用非得去搞Python代码(虽然Python更灵活)。重点是要设置好Buffer距离和排除面。比如你的研究区域旁边有条高铁,那就在排除面里把高铁两侧500米给挖空。还有,千万别忽略边缘效应。如果你的研究区域是个不规则多边形,边缘处的点位可能受外部环境影响大,可以试着做个收缩操作,只取中心90%的区域来提取对照点。
做数据就是这样,没有什么银弹技巧,全是经验主义的坑。你踩得多了,就知道geo数据中对照组提取的核心不是算法多高级,而是逻辑有多严密。把样本的随机性、空间代表性、数据可用性这三点平衡好,你的结果大概率不会翻车。与其纠结复杂的统计模型,不如先把这一步做扎实。毕竟,垃圾进,垃圾出。】