ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

nn-zero-to-hero 神经网络教程:如何手写反向传播、从零搭语言模型

nn-zero-to-hero 神经网络教程:如何手写反向传播、从零搭语言模型 nn-zero-to-hero 神经网络教程如何手写反向传播、从零搭语言模型【免费下载链接】nn-zero-to-heroNeural Networks: Zero to Hero项目地址: https://gitcode.com/GitHub_Trending/nn/nn-zero-to-hero这是 Neural Networks: Zero to Hero 课程的配套笔记。仓库很轻一个 lectures/ 目录、7 个 Jupyter 笔记本外加当目录用的 README.md。它不教你调 API只把反向传播和语言模型一行行推给你看。推完你能自己讲清梯度的每一步。和直接调 API 比差在哪你卡住的点通常是两个梯度为什么这么传、BatchNorm 不加会崩。官方文档只讲调什么不推为什么。这个仓库把推导做成了能跑的笔记本micrograd 是手写的标量自动求导引擎每个算子前向和反向都摊开写。差别很直接——这里每一步都能打印数值、逐层核对。推导可验证不是调完接口就走。三段路线图热身 → 主线 → 进阶 ️热身micrograd 的 2 个笔记本都在 lectures/micrograd/ 下。先手搓标量自动求导引擎再搭小网络做训练。学完你能把链式法则真正用到计算图上。主线part1 到 part2。从 makemore_part1_bigrams.ipynb 的二元统计模型起步再升级成 MLP。学完你能独立训一个字符级语言模型盯着 loss 曲线看它收敛。进阶part3 到 part5。BatchNorm、手写反向传播、类 WaveNet 的 CNN。学完你能逐层说清梯度从哪来、到哪去。三个阶段每段只多一层复杂度。三步跑通每步都有验收标志 克隆仓库顺序跑通 micrograd 两个笔记本git clone https://gitcode.com/GitHub_Trending/nn/nn-zero-to-hero 完成标志第一半场能打印出你手写表达式的梯度值。跑通 part1 bigrams让模型采样并打印名字。 完成标志生成结果像一串英文人名。按 part2 到 part5 推进每层打印张量 shape。 完成标志在 makemore_part4_backprop.ipynb 里不靠 autograd 推完整个网络的梯度。三步走完进度到哪、差在哪自己看得一清二楚。四个常见误区 ⚠️× 跳过 micrograd 直奔 makemore → 自动求导全成黑盒part4 手写反向传播基本做不动 → 先把 micrograd 两个笔记本推完再进场。× part4 只看不写 → 这讲本身就是练习题纯看只剩零散直觉 → 每层暂停自己推卡住再看答案。× part5 靠猜张量形状 → 那一节 torch.nn 用法密度高形状对不上全线卡住 → 多打印 shape拿不准就查文档。× 在仓库里找 GPT 的笔记本 → 第 7、8 讲GPT、GPT 分词器目前只有视频仓库内没有对应笔记本 → 先把现有 7 个笔记本做完。四条都是反复有人栽过的绕开能省你一整晚。开跑前先做个适配自检适合刚入门、想弄清反向传播到底在算什么的人天天用 PyTorch 但没手写过 autograd 的开发者。不适合只想快速调现成模型出效果的场景这套课节奏偏慢。前置要求记得住导数定义和链式法则微积分底子薄的话先复习一遍再开第一讲。今晚打开 micrograd 第一半场跑起来能独立推完 part4PyTorch 背后的魔法才真正变透明。【免费下载链接】nn-zero-to-heroNeural Networks: Zero to Hero项目地址: https://gitcode.com/GitHub_Trending/nn/nn-zero-to-hero创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表