ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

八问八答搞懂Transformer内部运作原理

八问八答搞懂Transformer内部运作原理 前言七年前论文《Attention is all you need》提出了 transformer 架构颠覆了整个深度学习领域。如今各家大模型都以 transformer 架构为基础但 transformer 内部运作原理仍是一个未解之谜。去年transformer 论文作者之一 Llion Jones 宣布创立人工智能公司 Sakana AI。近期Sakana AI 发表了一篇题为《Transformer Layers as Painters》的论文探究了预训练 transformer 中的信息流并针对仅解码器和仅编码器冻结 transformer 模型进行了一系列实验。请注意该研究没有对预训练模型进行任何类型的微调。论文地址https://arxiv.org/pdf/2407.09298v1该研究认为 transformer 的内部机制特别是中间层可以类比画家作画流水线来理解。作画流水线通常是将画布输入传递给一系列画家。有些画家擅长画鸟类而另一些画家则擅长画轮子。每个画家从其下一级画家那里收到画布然后其决定是否给画作添加一些笔画或者只是将其传递给其上一级画家使用剩余连接。这个类比并不是一个严格的理论而是一个思考 transformer 层的工具。受这个类比的启发该研究测试验证了一些假设各层是否都在使用相同的表征空间所有层都是必要的吗中间层都执行相同的功能吗层的顺序重要吗这些层可以并行运行吗对于某些任务来说顺序是否比其他因素更重要循环有助于层并行吗哪些变体对模型性能影响最小该研究对预训练 LLM 进行了一系列实验其中包括试验标准 transformer 执行策略的变化并在仅解码器 (Llama) 和仅编码器 (BERT) 模型的各种基准上测量这些变化对模型性能的影响。各层是否都在使用相同的表征空间为了回答不同层是否使用相同的表征空间作者测试了 Transformer 在跳过特定层或切换相邻层的顺序时是否具有稳健性。例如在 Llama2-7B 中第 6 层通常期望接收第 5 层的输出。如果给第 6 层以第 4 层的输出它是否会出现「灾难性」的行为在图 2 中我们可以看到除了第一层和最后几层之外Llama2-7B 的各层对跳层或切换层都相当稳健。该实验表明中间层共享一个表征空间且与「外围层」第一层和最后几层拥有不同的表征空间。为了进一步验证这一假设作者效仿之前的研究测量了基准中模型Llama2-7B、Llama2-13B 和 BERT-Large不同层的隐藏状态激活之间的平均余弦相似度。图 3 显示了所有中间层之间的一致性。这表明该模型可能具有「开始」、「中间」和「结束」层的三个不同的表征空间。回答问题 1是的中间层似乎共享一个共同的表征空间。所有层都是必要的吗为了进一步测试中间层的重定向空间是否真正共享除了具有接近的余弦相似度之外该研究尝试了「跳过层」即将第 N 层的输出直接发送到第 N M 层其中 M 1的输入中从而「跳过」M − 1 层如图 1a 所示。该实验是为了看看第 N M 层是否可以理解第 N 层的激活尽管它仅根据从第 N M − 1 层发来的输入进行训练。图 4 显示Llama2-7B 和 BERT-Large 在许多基准测试上性能均出现适度下降。回答问题 2是否所有层都是必要的不至少可以删除一些中间层而不会发生灾难性故障。中间层都执行相同的功能吗如果中间层都共享一个共同的表征空间这是否意味着除此之外的中间层是多余的呢为了测试这一点研究者们重新运行了前一子节中的「跳过」实验他们将中间层的权重替换为中心层的权重有效地在被替换的每一层上循环 T - 2N 1 次其中 T 是总层数Llama2-7B 为 32 层BERT-Large 为 24 层。如图 5 所示可以观察到随着被替换层数的增加模型在基准测试的得分迅速下降。从后文的图 11 看来这种替换层的做法比研究者们尝试的其他方法都更糟糕。因此研究者得出结论中间层执行的是不同的功能让中间层之间共享权重并不可行。层的顺序重要吗之前的实验表明中间层共享一个表示空间但在该空间中负责不同的功能。下一个需要解决的问题是这些功能的顺序有何意义。为了解决这个问题研究者们设计了两组实验。首先以与训练时相反的顺序来运行中间层。具体来说取第 T - N 层的输出将其输入到第 T - N - 1 层然后将这一层的输出输入到第 T - N - 2 层依此类推一直到第 N 层再将这一层的输出发送到后面的 T - N 层。在第二组实验中研究者采用随机顺序运行中间层并在 10 个种子值上取平均值。图 6 和图 7 分别显示了反向和以随机顺序运行中间层的结果模型在所有基础测试集中都显示出了逐渐下降的趋势。这也表明虽然层的顺序对模型来说有一定的重要性但即使改变了顺序这些层仍然能够发挥作用。更有趣的是随机打乱层的顺序比完全反过来效果更好。这可能是因为随机打乱的顺序在某些方面保留了层之间的一些原有关系即层 i 在层 j 之后其中 i j而完全反过来则完全打破了这些关系。这些层可以并行运行吗为了验证层本身存在比执行的顺序更重要研究者们设计了一个实验并行运行中间层将它们的平均结果发送给最终的 N 层。如图 8 所示模型在所有基准测试中的表现均呈现了一种平缓下降趋势然而这种趋势并不适用于 GSM8K 中的数学应用题。实验结果显示大部分情况下这种方法都是有效的只是一些复杂的数学题处理得不太好。这种并行处理方法相比直接跳过一些层效果更好但不如按反向顺序运行层的效果出色。基于此研究者得出结论并行运行层在一般情况下是可行的但对于需要顺序逻辑理解的数学问题这种方法可能不太适用。对于某些任务来说顺序是否比其他因素更重要对于大多数经过「改造」的模型在面对抽象推理ARC或数学推理GSM8K基准测试时它们往往显示出最陡峭的下降趋势。这一现象可能源于逐步推理任务对于模型层级顺序的敏感度远高于那些主要依赖语义理解的常识性任务。与那些仅通过理解语义便能完成的任务不同推理任务要求模型同时把握结构与含义。这种观察与模型在单次处理过程中可能进行一定程度的顺序依赖性推理的假设相吻合。研究者使用了一个比喻来说明如果画一幅由许多不同元素组成的拼贴画那么画的顺序可能不那么重要但如果是要画一幅精确的建筑场景那么每一笔的顺序就变得非常重要了。据此研究者得出了结论数学和推理任务对模型层的顺序具有更高的依赖性而对于那些主要依赖语义理解的任务顺序的影响则相对较小。循环有助于层之间并行吗沿用上一节中画画的的比喻当画家在画一幅画时不是一开始就画所有东西而是先画一部分比如车身然后再根据这部分来添加其他的东西比如车轮。在 AI 模型中层就是所谓的画家处理信息就是在画画如果先得到了正确的信息也就先画出了所谓的车身那么它们就能更好地完成自己的工作为画作添加车轮。对于 transformer 而言当给予适当的输入时层可能只在前向传播中做出贡献并非通过残差连接「传递」输入。如果情况确实如此那么迭代上一个实验中的并行层应该比单次执行并行层更能提高模型的性能。基于此研究者通过将并行层的平均输出反馈到同一层中进行固定次数的迭代来测试这一点。图 9 展示了将并行层循环 3 次的结果。循环并行 3 次的结果显著优于单次迭代并行层。起始层 N 设定为 15针对 Llama2-7B 模型或 11针对 BERT 模型时即处于每种情况的极左端点仅有单一的层级受到影响。在这种特定情况下三次循环并行的效果等同于单纯地将中间层重复三次。与此同时对于这一点上的并行层而言其性能与完整模型无异。研究者们还针对不同的迭代次数重复了相同的实验。图 10 展示了 Llama2-7B 的性能随并行化层数 M 和迭代次数的变化情况。每个 M 的最高性能迭代次数用红框标出。除了 M29 和 M31几乎并行化所有层外最佳迭代次数大致与并行化层数成线性比例。因此研究者得出的结论是最佳迭代次数与并行化层数成正比。如何调整层对模型性能的影响最小最后在图 11 中研究者们将所有实验中对 Transformer 的「改造」进行了比较在一个图表上显示了所有基准测试的中位数或平均性 。中间重复 —— 用相同数量的中间层副本替换中间层 —— 表现最差 很快就降到了随机基线的性能。相反循环并行和随机层顺序的影响最小。因此研究者得出的结论是重复单一层的影响最严重。随机化层顺序和循环并行的影响最小。这些实验整体上显示出平缓的性能下降但研究者仍然不清楚为什么这些层在大多数扰动下还能保持一定的稳健性这个问题还需在未来的研究中进一步探讨。最后的最后感谢你们的阅读和喜欢我收藏了很多技术干货可以共享给喜欢我文章的朋友们如果你肯花时间沉下心去学习它们一定能帮到你。因为这个行业不同于其他行业知识体系实在是过于庞大知识更新也非常快。作为一个普通人无法全部学完所以我们在提升技术的时候首先需要明确一个目标然后制定好完整的计划同时找到好的学习方法这样才能更快的提升自己。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】大模型知识脑图为了成为更好的 AI大模型 开发者这里为大家提供了总的路线图。它的用处就在于你可以按照上面的知识点去找对应的学习资源保证自己学得较为全面。经典书籍阅读阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。实战案例光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表