AI大模型与数学 第2课:函数四则运算、复合函数、分段函数
前言AI核心意义所有大模型本质就是一个超级复杂的巨型函数输入文本 → 函数输入 x模型参数 → 函数内部规则输出答案 → 函数输出 y简单函数叠加、嵌套、分段组合最终堆叠出 GPT注解如下Transformer 的亿万级复合函数。本课是AI深度学习、激活函数、网络层嵌套的地基中的地基。GPT全称与基础定义GPT Generative Pre-trained Transformer拆解单词Generative 生成式模型不是检索现成答案而是逐字逐个生成全新文本Pre-trained 预训练先用海量全网文本做全局通用学习再针对细分任务微调Transformer底层网络架构全部基于线性代数、复合函数、注意力机制搭建。GPT本质超大尺度复合函数输入文字向量输出文字概率分布就是开篇记住的那句话用海量数据拟合超高维语言概率分布。一、函数本质数学定义函数给定自变量 x唯一确定对应因变量 y 的映射关系y f(x)同一个输入工艺不变输出永远不变。大模型训练就是不断微调“工艺规则 f”让输出更贴合人类语言。AI对应单层神经网络 简单函数多层神经网络 复合函数嵌套激活函数 分段函数二、函数四则运算模型叠加的底层逻辑两个函数f(x),g(x)加法 h(x)f(x)g(x)类比双配方叠加芝士面包配方 奶油面包配方 双料面包AI意义特征叠加模型同时捕捉两种语义特征、两种图像特征。减法 h(x)f(x)-g(x)类比特征抵消减去冗余信息、减去噪声AI意义残差网络、误差修正乘法 h(x)f(x)\cdot g(x)类比特征权重放大主特征 × 重要程度Transformer注意力机制核心就是函数相乘除法 h(x)\dfrac{f(x)}{g(x)}类比归一化、均衡化大模型向量缩放、概率归一化常用总结网络参数融合 函数四则运算三、复合函数深度学习灵魂定义y f(g(x))先算内层 g(x)再把结果送入外层 f(\cdot)面包店类比x原材料g(x)揉面、发酵第一层网络f(x)烘烤、上色第二层网络先发酵、后烘烤顺序不可逆AI核心深度学习 多层复合函数嵌套\text{Output} f_n(f_{n-1}(\dots f_1(x)\dots))浅层模型2–3层复合大模型上千层复合嵌套关键性质必须掌握的AI逻辑不可逆嵌套越深越难反推原始输入。特征提纯每一层提取更高维度特征。非线性叠加简单函数嵌套变超级复杂函数。四、分段函数激活函数本质定义同一个函数不同区间、不同公式f(x)\begin{cases}f_1(x)0f_2(x) x\ge0\end{cases}类比面包店分级质检原料不合格 0 → 直接丢弃输出0原料合格 x\ge0 → 正常加工输出成品AI最重要结论所有神经网络激活函数全部是分段函数ReLU、Sigmoid、Tanh 全部基于分段逻辑没有分段函数神经网络就是纯线性无法学习复杂世界。线性VS非线性AI质变点单纯四则运算永远是线性函数只能处理简单问题加入分段/复合产生非线性大模型智能来源五、三大核心函数精讲AI高频函数二次函数 yx^2性质全局光滑、对称永远非负底部收敛、两侧发散AI类比误差损失函数MSE均方误差就是 x^2 结构偏差越大、惩罚力度平方级暴增用于模型纠错。正弦函数 y\sin x性质周期性、震荡、正负交替、平滑波动AI意义傅里叶变换基底时序模型、波、周期信号建模核心正弦位置编码Transformer标配指数函数 ye^x性质增长爆炸、光滑递增、永不归零AI意义Softmax概率归一化核心模型梯度传播核心所有概率类AI输出离不开 e^x六、Python实战绘制三大函数完整图像可直接运行无报错、可用于学习存档七、本课终极AI总结一句话通透四则运算 模型特征融合复合函数 神经网络层层堆叠分段函数 激活函数赋予AI非线性智能x^2 负责纠错、\sin x 负责时序、e^x 负责概率大模型的亿万参数本质只是这三类初等函数的无限嵌套与叠加。随着课程难度的增加我会根据我的理解增加类比帮助大家更好的理解与记忆。