ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

云计算中的数据科学入门:Data-Science-For-Beginners 第 17 课「云计算入门」全解

云计算中的数据科学入门:Data-Science-For-Beginners 第 17 课「云计算入门」全解 云计算中的数据科学入门Data-Science-For-Beginners 第 17 课「云计算入门」全解【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners本篇指南以 Data-Science-For-Beginners 课程第 5 单元第 17 课《云计算中的数据科学入门》为骨架系统讲解云计算的核心概念公有云 / 私有云 / 混合云、IaaS / PaaS / SaaS、数据科学团队选择云平台的七大理由以及两个真实落地的云上数据科学案例Twitter 实时情感分析与 COVID 科学论文分析。学完本文你将能够准确判断数据科学为什么要上云并理解云服务在数据存储、集成、分析、机器学习的完整价值链中扮演的角色。《云计算中的数据科学入门》速记图 —— 课程配套 sketchnote什么是云What is the Cloud云Cloud又称云计算Cloud Computing是指通过互联网在托管基础设施上按需交付范围广泛的按使用付费pay-as-you-go计算服务。这些服务涵盖存储、数据库、网络、软件、分析以及各类智能服务。课程将云分为三种部署形态这是理解一切云上数据科学方案的基础公有云Public cloud由第三方云服务提供商所有并运营将其计算资源通过互联网交付给公众使用。例如你无需自建机房即可直接申请一台虚拟机或一个对象存储桶。私有云Private cloud指仅供单一企业或组织独占使用的云计算资源服务与基础设施维护在私有网络中适合对数据主权、合规性要求极高的场景。混合云Hybrid cloud结合公有云与私有云的系统。用户保留本地on-premises数据中心的同时允许数据与应用运行在云端实现核心数据留本地、弹性负载上云端的灵活架构。云服务的三种模型IaaS、PaaS、SaaS大多数云计算服务可归为以下三类其核心差异在于用户管理边界不同——云提供商替你承担的基础设施层越多你需投入的运维就越少基础设施即服务Infrastructure as a ServiceIaaS用户租用 IT 基础设施包括服务器、虚拟机VMs、存储、网络、操作系统。用户仍需自行管理操作系统之上的一切适合需要完全掌控运行环境的场景。平台即服务Platform as a ServicePaaS用户租用用于开发、测试、交付和管理软件应用的完整环境。用户无需关心底层服务器、存储、网络和数据库的搭建与维护可专注于业务代码本身。对数据科学家而言托管的数据仓库、分析平台多属此类。软件即服务Software as a ServiceSaaS用户按需、通常以订阅方式通过互联网获得软件应用的使用权。用户无需操心软件的托管、底层基础设施以及升级和补丁维护开箱即用。目前全球规模最大的云服务提供商包括Amazon Web ServicesAWS、Google Cloud PlatformGCP和Microsoft Azure。为什么选择云来做数据科学开发者与 IT 专业人员选择云通常出于以下七大理由原文逐一列举这里完整保留并补充解读创新Innovation把云提供商自研的创新服务直接集成进应用例如认知服务、流分析、AutoML快速为产品加能力。灵活性Flexibility按需选择服务、按使用量付费pay-as-you-go随业务需求变化随时调整服务组合。预算Budget无需前期重资产投入购买硬件软件、建设并运营本地数据中心只为自己实际使用的资源买单把资本支出转化为运营支出。可扩展性Scalability资源可随项目需求自动伸缩——计算、存储、带宽随外部因素动态增减避免峰值算力不够、闲时算力浪费。生产力Productivity把数据中心管理这类可外包的琐事交给云厂商团队专注核心业务。可靠性Reliability云提供多种持续备份机制可配置灾难恢复disaster recovery计划让业务在危机时刻依然在线。安全性Security受益于云厂商的策略、技术与管控从物理安全到数据加密全面加固项目安全。数据科学家面临的挑战与云上解法课程进一步把云的价值映射到数据科学家日常的五大工作负载存储海量数据不必采购、管理并防护大型服务器可直接把数据存入云端例如 Azure Cosmos DB、Azure SQL Database 与 Azure Data Lake Storage 等托管存储方案。执行数据集成数据集成是数据科学的关键环节帮助团队从采集数据走向采取行动。借助 Data Factory 等云上数据集成服务可从多种来源收集、转换并整合数据汇入统一的数据仓库。处理数据处理海量数据需要巨大算力并非人人都拥有足够强大的机器云上超大规模算力让运行与部署解决方案成为可能。使用数据分析服务如 Azure Synapse Analytics、Azure Stream Analytics、Azure Databricks帮助把数据转化为可执行的洞察actionable insights。使用机器学习与数据智能服务不必从零造轮子可直接使用云厂商提供的机器学习算法如 AzureML以及语音转文字、文字转语音、计算机视觉等认知服务。实战案例一实时社交媒体情感分析课程给出的第一个案例是机器学习入门者最常研究的场景之一Twitter 实时情感分析。业务背景假设你运营一个新闻媒体网站希望借助实时数据了解读者可能感兴趣的内容。你可以构建一个程序对 Twitter 上与读者主题相关的推文进行实时情感分析。关键观测指标特定话题hashtag的推文数量volume以及通过分析工具对指定话题进行情感判定sentiment。搭建该项目的完整步骤原文步骤逐一保留创建事件中心Event Hub作为流式输入用于收集 Twitter 数据配置并启动 Twitter 客户端应用调用 Twitter Streaming API创建一个 Stream Analytics 作业指定作业的输入与查询query创建输出接收器output sink并指定作业输出启动作业。这是一条典型的流式数据管道链路数据源Twitter→ 事件中心 → 流分析作业 → 输出完整过程可参考微软 Stream Analytics 官方文档。实战案例二科学论文分析第二个案例来自本课程作者之一Dmitry Soshnikov的真实项目分析 COVID 相关科学论文从海量论文中提取知识、获得洞察帮助研究者高效地在大型论文集合中导航。该项目的技术拆解如下原文步骤逐一保留抽取与预处理信息使用 Text Analytics for Health医疗文本分析服务从论文中抽取并预处理结构化信息并行化处理使用 Azure ML 将处理过程并行化应对大规模论文语料的算力需求存储与查询使用 Cosmos DB 存储并查询抽取出的信息提供低延迟的检索能力可视化使用 Power BI 构建交互式仪表盘用于数据探索与可视化。从文本抽取 → 并行计算 → 存储查询 → 交互可视化的完整链路可以看出云服务可以以多种方式支撑端到端的数据科学项目。课程脉络从云入门到 Azure ML 实战本课是 5-Data-Science-In-Cloud 单元的第一课。该单元在云概念基础上继续围绕心力衰竭预测项目Heart Failure Prediction展开以两种方式完整演示训练—部署—消费模型的全流程数据来自公开的 Heart Failure Clinical Records 数据集第 18 课——低代码 / 无代码方式在 Azure Machine Learning Studio 中通过图形界面完成 AutoML 训练、部署与端点消费适合快速验证项目可行性、搭建概念验证POC。详见 18-Low-Code 课程。第 19 课——Azure ML SDK 方式用代码以编程方式自动化一切满足生产级需求。例如用Workspace.from_config()加载工作区、创建实验实验名须为 3–36 个字符仅含字母、数字、下划线与短横线并通过AmlCompute.provisioning_configuration(vm_sizeStandard_D2_v2, min_nodes1, max_nodes3)创建计算集群。AutoML 训练则通过 AutoMLConfig 配置关键参数experiment_timeout_minutes实验超时时间、max_concurrent_iterations最大并发迭代数、primary_metric主指标如AUC_weighted、task任务类型可取 classification / regression / forecasting、training_data含特征与标签列的训练数据、label_column_name标签列名、enable_early_stopping提前停止与featurization特征化策略再通过experiment.submit(automl_config)提交训练以remote_run.get_output()获取最优模型并注册。这两课之间的取舍逻辑值得留意低代码路线上手快、适合验证可行性但当项目走向生产时资源创建、模型部署都必须以代码自动化的方式落地这正是 Azure ML SDK 的用武之地。课后作业云服务商数据科学能力市场调研本课的配套作业是市场调研Market Research课程已指出 AWS、GCP、Azure 等多家重要云服务商作业要求进行市场调研分析各家能为数据科学家提供什么服务、这些服务是否具有可比性并撰写一篇报告描述至少三家云服务商的数据科学产品并加以区分。评分标准Rubric明确给出了质量梯度优秀Exemplary合格Adequate待改进Needs Improvement一篇一页纸的报告描述了三个云服务商的数据科学产品并做出区分提交了篇幅较短的报告提交了报告但未完成分析这一作业的落点正是本课正文的价值延伸只有理解了 IaaS / PaaS / SaaS 的层次划分与各类云上数据服务才能对不同厂商的数据科学全家桶做出有依据的比较。小结本课回答了三个递进的问题云是什么按需交付的计算服务分公有 / 私有 / 混合三种形态按 IaaS / PaaS / SaaS 三个层次提供、为什么用云做数据科学创新、灵活、预算、可扩展、生产力、可靠、安全七大理由以及对存储、集成、处理、分析、机器学习五类负载的具体帮助、云上数据科学长什么样Twitter 情感分析、科学论文分析两个真实案例。它也为后续第 18、19 课的 Azure ML 实操铺平了概念基础。学习建议在学习第 17 课后建议依次完成课后测验与市场调研作业再进入低代码 / 无代码与 Azure ML SDK 两课亲手将本文提到的概念落地为真实可运行的云上模型。【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表