ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

【数据分析八步法】识别并处理缺失、重复、异常与关联错误

【数据分析八步法】识别并处理缺失、重复、异常与关联错误 小周按前一篇的来源台账取回支付订单、退款和门店历史。第一眼看,数据量足够,字段也齐全;合并后却出现一个奇怪结果:某门店的订单数没有变,收入突然翻倍。追查发现,一张订单关联了两条退款记录,直接连接后订单金额被重复计算。若只盯着“缺失值有多少”,这类关联错误会悄悄穿过清洗环节,最后变成看似合理的图表。本文讲数据分析第四步:先体检、再分类处理,最后复核处理前后的业务总量。案例是虚构数据,示例中的“异常”指需要调查的记录,不等于可以直接删除的错误。数据清洗的目标不是把表修得好看,而是让后续指标在既定口径下可信且可追溯。文章目录先确定数据一行应该代表什么把数据问题分成不同类型用一个小样本做质量体检处理前后必须做业务对账总结先确定数据一行应该代表什么订单表以订单 ID 为一行,退款表以退款事件为一行,门店历史表以门店编码和生效期为一行。若不先声明粒度,就无法判断重复:相同订单 ID 在订单主表里出现两次可能是重复导出;在商品明细表里出现多次则完全正常。小周给每张表写出唯一键与预期连接关系,再计算任何收入。表预期粒度唯一性检查连接前需要做什么支付订单一行一张订单订单 ID 唯一对重复状态版本选定有效记录退款记录一行一次退款事件退款事件 ID 唯一按原订单 ID 汇总有效退款门店历史一行一个生效区间同一门店的区间不能无故重叠按订单时点匹配有效版本商品明细一行一种商品明细订单 ID 与明细号组合唯一先汇总到订单层,避免扩行订单与退款记录若先合并再求支付金额,一笔订单对应两次退款时会出现两行相同的支付金额。正确方向是先把退款按订单汇总,再
返回列表