机器学习:数据的获取

机器学习:数据的获取
1.2数据的获取发现或整合一个外部数据丶生成数据获取数据的三种途径1. 识别现有数据集Identify existing datasets看公司内部或公开渠道已经有哪些数据可以用2. 找基准数据集Find benchmark datasets 用标准数据集来“验证新想法/新算法”的效果 测试新的超参数调优算法→用一组小到中等规模的多样化数据集测试大型深度神经网络→用大规模数据集3. 收集新数据Collect new data当现有数据不够时主动去采集三种不同的数据集类型优点(Pros)缺点(Cons)学术数据集Academic datasets干净、难度适中选择有限、过于简化、通常规模小竞赛数据集Competition datasets更接近真实的ML应用仍然经过简化且只覆盖热门话题原始数据Raw Data灵活性极高需要大量精力来处理学术界用的干净数据集和工业界的原始数据是两回事。 在学校做实验可以用现成的benchmark但进了公司大部分时间都在洗数据而且这不仅是技术活还涉及法律、隐私、跨部门协作。数据整合数据整合 把多个数据源的数据合并成一个连贯的数据集怎么关联通过键Keys用实体ID作为连接键把不同表Join在一起Inner Join只保留两个表都有的记录交集Left Join保留左表全部记录右表没有就填NULL可能出现的问题识别ID不同系统对同一个实体的ID可能不一样缺失行某些记录在部分表中不存在冗余列多个表有重复信息需要去重值冲突同一个字段在不同表中数值不一致生成数据的两种方法1. 生成合成数据Generate synthetic data2. 数据增强Data augmentations在现有数据上做变换变出更多训练样本