ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Data Science for Beginners 第一课作业实战:从数据收集到决策的完整场景推演

Data Science for Beginners 第一课作业实战:从数据收集到决策的完整场景推演 Data Science for Beginners 第一课作业实战从数据收集到决策的完整场景推演【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners导读本篇文章围绕 Data Science for Beginners 课程第一课Defining Data Science的课后作业数据科学场景Data Science Scenarios展开指导你完成一次完整的数据科学思维演练面对教育、疫苗接种、工作效率三个真实问题域依次回答收集什么数据、如何收集、如何存储、能得出什么洞察与决策四个问题并用课程提供的表格模板沉淀成果。读完本文你将掌握用数据旅程五步法拆解现实问题、区分结构化/非结构化数据、设计存储方案并推导可执行决策的完整方法同时看到课程仓库中官方示例答案与配套 Jupyter Notebook 的真实写法。作业背景先用数据科学的定义校准思路本作业对应的课程内容位于 1-Introduction/01-defining-data-science/README.md。该课对Data Science的定义是使用科学方法从结构化与非结构化数据中提取知识与洞察并将这些知识应用于广泛的应用领域。这个定义在作业中有四个直接落脚点提取知识作业要求从数据中获得洞察本质就是从数据中找到隐藏关系并形成理解科学方法作业涉及的数据收集、存储设计需要遵循概率与统计等学科的方法论可执行的洞察Actionable Insights作业表格的最后一列我们能做出哪些决策强调洞察必须能落地到真实业务或管理情境应用领域Application Domain作业特意给出教育、疫苗接种、生产力三个不同的应用领域提醒你数据科学家需要对问题域有一定理解而不是只懂算法。课程还将数据科学视为继经验科学Empirical、理论科学Theoretical、计算科学Computational之后的第四种科学范式——数据驱动Data-Driven即基于数据中发现的模式与关系得出结论。本作业正是对数据驱动范式的一次入门训练不靠直觉而是先定义数据、再基于数据做决策。作业目标四问推演一个数据科学场景原作业要求对每个问题域依次思考四个问题这是整个数据科学流程的浓缩可以收集哪些数据Which data can you collect?如何收集这些数据How would you collect it?如何存储数据数据规模大约多大How would you store the data? How large the data is likely to be?能从中获得哪些洞察可以基于数据做出哪些决策Which insights you might be able to get from this data? Which decisions we would be able to take based on the data?作业要求你为3 个不同的领域/流程完整回答上述四问。课程提供了三个启动思路如何用数据改进学校里儿童的教育流程如何用数据在大流行期间控制疫苗接种如何用数据确保自己在工作中保持高效四问背后的理论支撑数据旅程五步法作业的四个问题正是课程 README 中数据旅程Data Journey五步的高度浓缩。对应关系如下作业四问数据旅程步骤课程要点收集什么数据① 数据获取Data Acquisition数据可能来自 IoT 传感器、问卷调查、行为分析等注意数据量可能过大如 IoT需要缓冲端点先汇聚如何存储② 数据存储Data Storage关系型数据库SQL、schema、NoSQL无强 schema、支持 JSON/图、数据湖Data Lake原始非结构化大数据常配 Parquet 格式能获得什么洞察④ 可视化/人类洞察通过可视化与统计手段检验假设、证明相关性能做出什么决策⑤ 训练预测模型用机器学习构建预测模型对新数据做出预测课程特别强调实际项目中某些步骤可能缺失如数据已在库中、无需建模某些步骤可能反复出现如数据处理。做作业时不必拘泥于五步全走完但数据获取 → 存储 → 洞察这条主链是必须打通的。这里要特别重视如何存储这一问它对应课程中数据类型的划分——结构化数据表格、SQL、半结构化数据JSON、网页、非结构化数据文本、图像、视频原文件。存储方案的选择本质上取决于数据类型和未来查询方式关系型数据库适合查询规则明确的结构化数据但往往需要把原始数据转换成符合 schema 的形式NoSQL 数据库如 CosmosDB不强制 schema能存层级化 JSON 或图数据但查询能力不如 SQL也无法强制引用完整性数据湖面向无法单机容纳的大数据以原始非结构化形态存储在服务器集群上。你在作业表格中填写的存储方式应与要收集的数据类型 数据量级 未来如何查询三要素自洽。三个问题域的示例推演教育场景官方示例答案的完整拆解课程仓库在 1-Introduction/01-defining-data-science/solution/assignment.md 中给出了教育域的一份完整示例它展示了什么叫合格的作业答案问题定义在大学里讲座出勤率偏低。存在一个假设——平均而言经常出席讲座的学生在考试中表现更好。我们希望刺激出勤率并检验这一假设。作业四问示例答案要点收集什么数据出勤数据 考试成绩。出勤可通过教室安防摄像头拍摄照片获得或追踪学生手机在教室内的蓝牙/Wi-Fi 地址考试成绩数据已存在于大学数据库中如何收集摄像头拍摄上课期间几张照片510 张手机信号追踪成绩直接从校内数据库导出如何存储摄像头照片属非结构化数据存储少量照片再用 AI 识别学生面部将非结构化数据转换为结构化形式洞察与决策计算每位学生的平均出勤率检验其与考试成绩是否相关相关性分析将在 04-stats-and-probability 部分深入讲解为激励出勤可在学校门户发布每周出勤排名并向出勤率最高的学生发放奖品这个示例展示了两个关键技巧其一同一份数据照片经历了非结构化 → 结构化的转换这正是数据旅程中数据处理Data Processing步骤的实战体现其二洞察相关性与决策出勤激励分开陈述避免把二者混为一谈。疫苗接种场景大流行期间的数据控制参考课程关于数据来源的分类IoT 传感器、调查问卷、日志等与存储方式的讨论可以这样推演疫苗接种场景收集什么数据各接种点每日接种剂数、疫苗库存、预约人数、各年龄段/地区人群接种覆盖率、不良反应报告数、新增病例数时间序列。如何收集接种点信息系统实时上报病例数据来自疾控中心上报通道可辅以移动端预约系统行为日志。如何存储核心是带时间维度的关系型数据适合用 SQL 数据库按地区、日期建立索引查询图像/文本类不良反应报告可作为非结构化数据存放。数据规模上若面向全国每日上百万条记录可能需要引入数据湖或分布式存储对应课程中大数据需要集群存储的论述。洞察与决策识别接种覆盖率与新增病例数的时序关系判断哪些地区覆盖不足、疫苗供应是否需要向高风险区域倾斜据此动态调整预约放号与宣传资源。仓库中 data/COVID 目录下的time_series_covid19_confirmed_global.csv、time_series_covid19_deaths_global.csv等真实时间序列数据正是此类场景的可用素材——你可以直接体验病例时序数据如何支撑疫情决策。生产力场景用数据确认工作效率沿用四问框架收集什么数据工作时长、任务完成数、会议时长、应用使用时长、产出物数量/质量评分。如何收集工时与任务数据来自项目管理工具 API应用使用时长来自系统日志产出质量可由团队互评或自动化检查获取。如何存储结构化为主任务表、时间记录表适合关系型数据库日志类数据量大、结构不固定适合日志存储或数据湖。洞察与决策找出高效时段与任务类型的关联优化日程安排识别低效环节如过长会议并推动流程改进。作业表格模板与填写指引原作业要求填写下方表格必要时可用自己的问题域替换建议领域请按问题 → 数据 → 存储 → 洞察/决策的列序逐一填写每一列都应回答上一节四问中的对应问题问题域问题需要收集哪些数据如何存储数据我们能获得哪些洞察/做出哪些决策教育疫苗接种生产力填写要点结合官方示例归纳问题列写清要解决的业务/流程痛点与待验证假设数据列区分结构化、半结构化、非结构化并注明数据规模量级如每天 510 张照片百万级记录存储列说明技术选型关系型/NoSQL/数据湖及选择理由洞察/决策列先写能发现的关系或结论再写由此驱动的具体行动二者分行或分句呈现。评价标准Rubric作业提交后按下表评估理解评分标准有助于你把握答案的完整度优秀Exemplary合格Adequate需改进Needs Improvement为所有问题域都识别了合理的数据来源、存储方式与可能的决策/洞察解决方案的某些方面不够详细未讨论数据存储至少描述了 2 个问题域只描述了数据方案的片段只考虑 1 个问题域对照可见数据存储这一问是拉开档次的差异点——合格的答案也常常在此缺失而优秀答案必须覆盖全部三个问题域且四个维度齐备。撰写时请务必给每个问题域都写出可落地的存储方案。配套仓库资源深化练习与动手验证完成本作业后可结合以下仓库资源进一步验证与拓展官方示例答案1-Introduction/01-defining-data-science/solution/assignment.md 提供教育域完整范例可作为自评参照。文本挖掘挑战 Notebook1-Introduction/01-defining-data-science/notebook.ipynb 完整演示了获取数据requests 下载 Wikipedia 页面→ 处理数据BeautifulSoup 提取正文、清洗导航与目录等噪声→ 提取洞察RAKE 关键词抽取→ 可视化matplotlib 柱状图与 WordCloud 词云的端到端流程是对作业四问中收集—存储—洞察链条最直观的代码印证课程还布置了扩展任务——把该流程应用到Big Data与Machine Learning两个领域。数据工作全流程课程2-Working-With-Data/README.md 与 3-Data-Visualization/README.md 分别深入讲解数据库与可视化为作业中存储与洞察两列提供系统化的后续学习路径相关性分析方法将在 04-stats-and-probability 一节详述。结语数据科学场景作业的价值不在于代码而在于让你在动手之前先养成数据驱动的问题拆解习惯无论领域是教育、公共卫生还是个人效率都要依次回答数据、获取、存储、洞察与决策五个问题。官方示例证明一份优秀的答案并不需要高深算法只需逻辑自洽、四个维度完整、并明确区分数据能告诉我们什么与我们据此做什么。以此为模板你也可以把同样的框架迁移到任何真实业务场景中。【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表