ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

规模驱动机器学习发展:数据与计算如何成就深度学习(Machine Learning Yearning 中文版 ch04 精读)

规模驱动机器学习发展:数据与计算如何成就深度学习(Machine Learning Yearning 中文版 ch04 精读) 文档教程【免费下载链接】machine-learning-yearning-cnMachine Learning Yearning 中文版 - 《机器学习训练秘籍》 - Andrew Ng 著项目地址https://gitcode.com/gh_mirrors/ma/machine-learning-yearning-cn点击查看免费下载导读本章是《机器学习训练秘籍》Machine Learning Yearning中文版的开篇核心章节回答了神经网络思想几十年前就有为什么现在才流行这一关键问题。文章将围绕**数据可用性data availability与计算规模computational scale**两大驱动力展开用学习曲线对比传统学习算法与不同规模神经网络的性能差异并给出获取最佳性能的两条主线策略——训练更大的网络、拥有更多的数据。读完本章你将掌握为什么深度学习需要大数据与大算力的底层判断逻辑并能据此为后续章节的模型调优方向做出更理性的取舍。在本书的 ch01 中我们设想了这样一个场景你在创办一家猫咪图片初创公司用神经网络构建计算机视觉系统来识别图片中的猫但算法准确度还不够好。面对获取更多数据、加大网络规模、换一种架构、加入正则化等一堆相互矛盾的建议你该如何选择本章ch04正是从深度学习为什么在近年崛起这一底层事实出发为这个选择给出第一个明确的方向性答案。一个看似矛盾的问题思想几十年前就有为何现在才流行关于深度学习神经网络的一些想法在几十年前就已经存在了。感知机、反向传播等基础思想都有着不短的历史但直到近些年神经网络才真正成为主流应用的引擎。为什么会出现这种迟到答案并不是神经网络本身变聪明了而是它赖以发挥威力的两个外部条件直到最近才成熟。推动其近期发展的主要因素有两个数据可用性data availability如今人们在数字设备笔记本电脑、移动设备等上花费的时间越来越多对应的数字化行为与活动产生了海量的数据而这些数据都可以提供给学习算法用来训练。搜索记录、点击日志、语音片段、图片、社交行为……每一个数字化动作都在源源不断地产生可标注、可学习的样本。计算规模computational scale在近几年前我们才开始有能力训练出规模足够大的神经网络来使用现有的海量数据集。换句话说数据早就开始积累但真正能消化这些数据的算力GPU 并行计算、分布式训练等基础设施的成熟是后来才跟上的。这两个因素缺一不可只有数据没有算力大网络训不动只有算力没有数据大网络又会过拟合。二者在时间上的交汇才是深度学习的流行时刻。传统学习算法的瓶颈性能平台期要理解神经网络为什么能在海量数据下胜出先要看传统学习算法在数据增长时的表现。具体来说即使你积累了更多的数据但应用在类似于对数几率回归logistic regression这样较传统的学习算法上其性能表现performance也将趋于平稳。这意味着算法的学习曲线将变得平缓就算提供更多的数据算法的性能也将不再提升。本章配图 ch04_01.png 直观展示了这一现象——随着横轴数据量增长红色曲线所代表的传统学习算法性能在上升一段后进入明显的平台期继续堆数据也不再换来性能提升。从机器学习理论的角度看这背后是模型容量model capacity与数据规模不匹配的问题对数几率回归这类模型的表达能力有限其假设空间很快就被数据喂饱了剩余的信息无法被模型利用于是曲线封顶。传统学习算法似乎并不知道要如何处理现今这般规模量级的数据——它们的瓶颈不在于数据而在于模型自身。神经网络从小到大的性能递进同样是监督学习任务选择训练一个小型的神经网络neural network, NN你可能会获得较好的性能表现。本章的 ch04_02.png 将传统学习算法红色与小型神经网络棕色放在同一坐标系下对比在低数据量阶段两者性能接近但随着数据量增加小型神经网络的性能上限明显高于传统学习算法。这里需要特别澄清小型的含义。文档中的小型神经网络指的是只含有少量的隐藏元hidden units、层layers或参数parameters的神经网络。它虽然比传统算法强但同样会受限于容量。如果你训练的神经网络规模越来越大最终很有可能会获得更好的表现ch04_03.png 给出了完整的四曲线对比绿色的大型神经网络、蓝色的中型神经网络、棕色的小型神经网络、红色的传统学习算法。规律非常清晰网络规模越大同数据量下的性能上限越高规模越大的网络其性能随数据量增长而持续上升的后劲越足平台期出现得越晚传统算法与小型网络较早触顶而中大型网络在大数据下仍能持续受益。这组曲线从经验层面印证了深度学习的基本规律模型容量与数据规模需要协同增长。小数据集下的反直觉提醒特征工程比选算法更重要文档中还给出了一条重要的反直觉提醒值得单独强调这种神经网络越大越好的结论主要适用于大数据场景在小数据集下并不成立。例如假设你只有 20 个训练样本那么使用对数几率回归还是神经网络可能无关紧要此时人为的特征选择工程feature engineering比起选择哪种算法将产生更大的影响。但如果你有 100 万个样本数据我会赞成你使用神经网络。换言之特征工程与模型选择的价值是随数据规模动态变化的数据规模关键决胜因素极小如 20 个样本人为特征选择工程 算法选择中等小数据集小型神经网络优于传统算法海量如 100 万样本大型神经网络 海量数据胜出这条提醒对实际工程的意义在于不要盲目迷信上大模型要首先评估手头的数据规模是否撑得起模型的容量。获得最佳性能的两条主线策略基于上述曲线规律文档给出了获得最佳性能表现的明确做法这也是全书的第一个实战性结论训练大型的神经网络效果如同 ch04_03 图中的绿色曲线拥有海量的数据。在算法训练时许多其它的细节也同等重要例如神经网络的架构激活函数、隐藏元数量、层数等。但就目前的经验而言提升算法性能的更加可靠的方法仍然是训练更大的网络以及获取更多的数据——架构调优、正则化、超参数搜索这些手段更多是在大网络 大数据这个基本盘之上锦上添花。这个结论也为 ch01 中猫咪初创公司的两难选择给出了第一层答案当团队纠结于换架构还是加数据时优先级应该是——先保证数据量和模型规模足够再谈细节优化。从通用策略到前沿策略本书的进阶路线文档在结尾处点出了全书的编排逻辑我们将从传统学习算法与神经网络中都起作用的通用策略入手循序渐进地讲解至最前沿的构建深度学习系统的策略。这一路线在仓库的导航配置 docs.yml 中体现得非常清楚ch04 属于 Getting Started入门章节随后的章节依次展开Setting up development and test setsch05 起如何科学地划分开发集与测试集设定单值评估指标Basic Error Analysisch13 起如何通过人工错误分析找到优先改进方向Bias and Variancech20 起区分高偏差与高方差对症下药Learning curvesch28 起用学习曲线诊断模型所处阶段Comparing to human-level performancech33 起以人类水平为基准判断改进空间Training and testing on different distributionsch36 起处理训练分布与测试分布不一致的问题Debugging inference algorithmsch44 起、End-to-end deep learningch47 起、Error analysis by partsch53 起直至Conclusionch58。读者可以按此路径先掌握适用于所有学习算法的通用诊断方法再深入到面向深度学习系统的前沿策略。在仓库中定位本章内容如果你希望在仓库中直接查看本章的原始文稿与素材可参照以下路径本章正文_docs/ch04.mdFront Matter 中title: 规模驱动机器学习发展permalink: /docs/ch04/本章配图ch04_01.png、ch04_02.png、ch04_03.png均存放于仓库的img/目录站点图片路径配置_config.yml 中通过imgurl定义图片的基础 URL文档正文用{{图片名 | prepend: site.imgurl}}的方式插入图片详见 README.md 的说明章节导航docs.yml 定义了各章节的分组与顺序ch04 位于 Getting Started 组内紧跟在 ch01–ch03 之后。小结本章用三张学习曲线图讲清了一个贯穿全书的核心事实深度学习的崛起不是思想的翻新而是数据可用性与计算规模两大外部条件成熟后的必然结果。传统学习算法在数据增长下会陷入性能平台期而神经网络的性能上限随规模增长而抬升——前提是有足够的数据支撑。由此得到的两条主线策略——训练更大的网络、拥有更多的数据将成为你在后续章节中评估一切调优手段的价值标尺。赞分享文档教程【免费下载链接】machine-learning-yearning-cnMachine Learning Yearning 中文版 - 《机器学习训练秘籍》 - Andrew Ng 著项目地址https://gitcode.com/gh_mirrors/ma/machine-learning-yearning-cn点击查看免费下载相关推荐《Machine Learning Yearning》解析数据规模与计算力如何推动深度学习发展《Machine Learning Yearning》解析数据规模与计算力如何推动深度学习发展 深度学习为何现在才爆发 深度学习的概念其实早在几十年前就已经文档教程SublimePrettyJson终极指南让JSON处理变得像呼吸一样自然SublimePrettyJson终极指南让JSON处理变得像呼吸一样自然 还在为杂乱无章的JSON数据而头疼吗面对API响应、配置文件、日志数据时你是否开发工具go2_ros2_sdk安全最佳实践保护Unitree GO2机器人通信的加密策略go2_ros2_sdk安全最佳实践保护Unitree GO2机器人通信的加密策略 go2_ros2_sdk是Unitree GO2 AIR/PRO/EDU机机器人ROS上一篇探索未来编程之道Futhark语言的终极指南下一篇GeneFacePlusPlus未来展望3D说话人脸生成技术的发展趋势创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表