
文档教程【免费下载链接】machine-learning-yearning-cnMachine Learning Yearning 中文版 - 《机器学习训练秘籍》 - Andrew Ng 著项目地址https://gitcode.com/gh_mirrors/ma/machine-learning-yearning-cn点击查看免费下载导读在机器学习中偏差bias与方差variance是一对贯穿模型改进全过程的核心矛盾传统观点认为减少偏差往往以增大方差为代价反之亦然这就是著名的偏差和方差间的权衡。本文以《机器学习训练秘籍》Machine Learning Yearning 中文版第24章为核心系统梳理偏差与方差的定义、经典权衡的形成机制以及现代深度学习时代如何借助充足数据 大规模神经网络 正则化打破这一零和博弈帮助你建立正确的直觉为后续各章学习曲线、误差分析等改进技术打下基础。一、偏差与方差机器学习误差的两大来源在讨论权衡之前先明确偏差与方差的非正式定义详见第20章。假设训练集、开发集和测试集来自同一分布算法在开发集上的错误率可以拆成两部分偏差bias算法在训练集上的错误率。它反映了算法拟合已知数据的能力。方差variance算法在开发集或测试集上比训练集差多少开发错误率 − 训练错误率。它反映了算法从训练集到新数据上的泛化能力。以猫识别器为例训练错误率 15%、开发错误率 16%则偏差约为 15%、方差约为 1%。如果目标是 5% 的错误率那么首要问题是提高算法在训练集上的性能——因为算法在开发/测试集上的表现通常不会优于训练集训练集上只有 85% 的精度就不可能在新样本上达到 95% 的精度。第21章给出了四种典型情形帮助建立直觉训练错误率开发错误率偏差估计方差估计结论1%11%1%10%高方差过拟合 overfitting15%16%15%1%高偏差欠拟合 underfitting15%30%15%15%高偏差 高方差同时欠拟合与过拟合0.5%1%0.5%0.5%低偏差 低方差表现优秀二、引入最优错误率更精细的误差分解仅仅看训练/开发错误率还不够第22章引入了最优错误率统计学上称为贝叶斯错误率 Bayes error rate对误差做更精细的分解。以语音识别为例假设 14% 的音频片段即使人类也无法听清那么最优语音识别系统本身也可能有约 14% 的误差。若算法训练错误率 15%、开发错误率 30%则 30% 的总误差可分解为最优错误率不可避免偏差14%可避免偏差1%训练错误率 − 最优错误率方差15%开发错误率 − 训练错误率。由此得到关系式偏差 最优错误率不可避免偏差 可避免偏差。这一分解有两个重要推论当可避免偏差为负算法在训练集上的表现优于最优错误率时说明算法已经过度记忆了训练集应专注降低方差而不是继续减少偏差最优错误率决定了还有多少提升空间——训练错误率 15% 在最优错误率接近 0% 时意味着偏差还有很大改善余地而在最优错误率为 14% 时则说明偏差方面几乎没有改进空间。如何估计最优错误率对于人类擅长的任务如图像识别、音频转录可让普通人提供标签并测评其相对训练集标签的精度对于人类也难以解决的问题如电影推荐、广告投放则很难估计。人类表现水平估计最优错误率的方法详见第33章。三、经典权衡模型规模与正则化的跷跷板回到本文主题——第24章开篇即指出在大部分针对学习算法的改进中减少偏差往往以增大方差为代价反之亦然于是产生了权衡。两个最典型的例子加大模型规模神经网络中增加神经元/层或增加输入特征通常能减少偏差但可能增加方差加入正则化如 L2、L1、dropout一般会增加偏差但能减少方差。这正是经典的零和博弈图景你想让模型更贴合训练数据降偏差就可能过拟合升方差你想让模型更平滑泛化降方差就可能欠拟合升偏差。四、现代深度学习为何权衡正在被打破第24章接着给出了一个关键的时代性判断在现代我们往往能够获取充足的数据并且可以使用非常大的神经网络深度学习因此这种权衡的情况比较少并且现在有更多选择可以在不损害方差的情况下减少偏差反之亦然。具体而言有三条双赢路径加大模型规模 调整正则化一般情况下可以通过增加神经网络的规模并调整正则化方法在不明显增加方差的情况下减少偏差。第23章进一步解释了原因加大模型规模确实可能带来过拟合风险但这种风险通常只在你不使用正则化技术的时候出现如果算法带有精心设计的正则化如 L2 dropout且正则化参数已在开发集上调到最优那么加大模型规模后算法表现往往会保持不变或提升不太可能明显变差——此时不使用更大模型的唯一理由只是计算代价。增加训练数据可以在不影响偏差的情况下减少方差。理论上只要训练集足够大方差可以降到接近零因此不存在所谓的不可避免方差。选择契合任务的模型架构如果你选对了模型架构可以同时减少偏差和方差。只是选择这样的架构可能有些难度——不同架构对同一问题会有不同的偏差/方差取值深度学习文献和开源实现如 GitHub 上的实现是重要的灵感来源但尝试新架构的效果比加大模型规模或添加数据更难预测。需要提醒的是这两条双赢路径并非无限可用。不断加大网络规模终将遇到算力瓶颈训练大型模型需要大量时间增加训练数据也会面临数据获取能力的上限正如书中举例即使是猫图片数量也是有限的。五、实操清单对症下药地减少偏差或方差理解权衡之后关键是判断当前是高偏差还是高方差再选择对应策略。诊断的简洁法则第23章如果具有较高的可避免偏差→ 加大模型规模例如添加层/神经元如果具有较高的方差→ 增加训练集的数据量。5.1 减少可避免偏差的技术第25章加大模型规模神经元/层的数量更好地拟合训练集从而减少偏差若发现方差增大用正则化抵消根据误差分析结果修改输入特征新增特征可消除特定类别的误差对偏差和方差都有帮助理论上加特征会增大方差可用正则化抵消减少或去除正则化L2、L1、dropout减少可避免偏差但会增大方差修改模型架构如神经网络架构使之更适用于问题同时影响偏差和方差。注意有一种方法并不奏效——添加更多训练数据只能帮助解决方差问题对偏差通常没有明显影响。5.2 训练集上的误差分析第26章算法必须先在训练集上表现良好才能期望它在开发集和测试集上表现良好。当算法高偏差没能很好拟合训练集时可以像开发集上设置 Eyeball 开发集那样在训练数据上做误差分析选取约 100 个算法处理得很差的样本人为检查并归类统计。书中以语音识别为例给出了一张错误类别统计表音频片段背景噪音很大语速太快距离麦克风太远备注1√汽车噪音2√√餐馆噪音3√√在起居室里喊叫4√咖啡厅占全体比例75%25%50%若发现大多数错误样本都带有大量背景噪音就可以针对性改进算法对背景噪音样本的适应能力。同时还应检查正常人能否转录这些音频——如果背景噪音大到任何人都无法理解那么期望算法正确识别就不合理这体现了与人类水平比较的价值。5.3 减少方差的技术第27章添加更多训练数据最简单、最可靠的处理方差策略前提是有足够数据和算力加入正则化L2、L1、dropout降低方差但增大偏差加入提前终止early stopping如根据开发集误差提前终止梯度下降降低方差但增大偏差一些学者将其视为正则化技术之一通过特征选择减少输入特征的数量和种类可能有助于解决方差但也可能增加偏差。小幅削减如 1000 → 900影响不大大幅削减如 1000 → 100可能排除太多有用特征。现代深度学习在数据充足时更倾向于把所有特征都给算法、让算法自己决定用哪些而训练集很小时特征选择非常有用减小模型规模神经元/层的数量谨慎使用。可减少方差但可能增加偏差书中并不推荐把它作为处理方差的首选添加正则化通常能更好地提升性能它的额外好处是降低计算成本、加快训练速度。此外还有两条与解决偏差章节重复的共享策略根据误差分析结果修改输入特征、修改模型架构——它们同时影响偏差和方差。六、全文脉络与仓库中的后续章节权衡章节是《机器学习训练秘籍》偏差和方差部分的承上启下之笔它建立在第20章误差两大来源与第21章偏差方差举例、第22章与最优错误率比较之上并为第23章处理偏差和方差的总体框架、第25章、第26章、第27章的具体技术清单提供了理论依据。后续的学习曲线章节第28~32章与与人类表现水平比较第33~35章将继续讨论处理偏差和方差的其它特定技术以及如何借助人类表现水平更精准地定位可避免偏差从而决定该优先减少偏差还是方差。当你的算法在训练集和开发集上表现都欠佳时不妨回到本文的框架先对照第22章的误差分解判断可避免偏差与方差的相对大小再在加大模型规模 正则化增加训练数据选择合适架构这三条现代深度学习路径中做选择——这正是第24章传递给读者的核心实战心法。赞分享文档教程【免费下载链接】machine-learning-yearning-cnMachine Learning Yearning 中文版 - 《机器学习训练秘籍》 - Andrew Ng 著项目地址https://gitcode.com/gh_mirrors/ma/machine-learning-yearning-cn点击查看免费下载相关推荐Astryx 主题所有权与物化Materialization系统规格Follow/Own 生命周期、Detach/Freeze 与可验证的原子写入Astryx 主题所有权与物化Materialization系统规格Follow/Own 生命周期、Detach/Freeze 与可验证的原子写入 本指南文档教程gpt-oss-puzzle-88B量化技术深度解析MXFP4与FP8如何实现2倍KV缓存容量提升 gpt oss puzzle 88B量化技术深度解析MXFP4与FP8如何实现2倍KV缓存容量提升 想要了解NVIDIA最新推出的gpt oss puz大模型基础模型人工智能NLPQSYM 核心架构全解析从 PIN 插桩到 Z3 求解QSYM 核心架构全解析从 PIN 插桩到 Z3 求解 QSYM 是一款面向混合模糊测试Hybrid Fuzzing的实用化符号执行引擎它的核心价值在于文档教程上一篇Bebas Neue当几何美学遇见开源自由下一篇暗黑破坏神2终极优化指南如何在现代PC上实现高帧率与高清分辨率创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考