ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

什么是 ELMo?它在预训练语言模型发展中的贡献是什么?

什么是 ELMo?它在预训练语言模型发展中的贡献是什么? ELMo深度上下文化的词向量表示一、什么是 ELMoELMoEmbeddings from Language Models是 Allen AI 研究院于 2018 年提出的深度上下文词向量表示方法论文发表于 NAACL 2018。核心思想ELMo 的核心在于词的表示不再是一个固定的向量而是整个输入句子的函数。同一个词在不同语境下会获得不同的向量表示。架构ELMo 使用双向 LSTMBiLSTM语言模型包含输入层 → 字符级 CNN 编码 → 双向多层 LSTM前向 后向 → 输出层组件作用字符级 CNN生成词的初始表示能处理 OOV未登录词和词形变化前向 LSTM从左到右建模捕获上文信息后向 LSTM从右到左建模捕获下文信息多层堆叠每层学习不同层次的语言特征训练目标同时优化两个方向的语言模型前向P(t1,t2,...,tN)∏k1NP(tk∣t1,...,tk−1)P(t_1, t_2, ..., t_N) \prod_{k1}^{N} P(t_k | t_1, ..., t_{k-1})P(t1​,t2​,...,tN​)∏k1N​P(tk​∣t1​,...,tk−1​)后向P(t1,t2,...,tN)∏k1NP(tk∣tk1,...,tN)P(t_1, t_2, ..., t_N) \prod_{k1}^{N} P(t_k | t_{k1}, ..., t_N)P(t1​,t2​,...,tN​)∏k1N​P(tk​∣tk1​,...,tN​)ELMo 向量的生成对于每个词ELMo 将所有层的隐状态加权融合ELMokγ∑j0Lsj⋅hk,j\text{ELMo}_k \gamma \sum_{j0}^{L} s_j \cdot h_{k,j}ELMok​γj0∑L​sj​⋅hk,j​其中sjs_jsj​是可学习的层权重γ\gammaγ是缩放因子hk,jh_{k,j}hk,j​是第jjj层对第kkk个词的隐状态。二、ELMo 在预训练语言模型发展中的贡献1. 开创了上下文相关词向量的范式在 ELMo 之前主流词向量方法Word2Vec、GloVe为每个词分配一个固定向量无法解决多义词问题苹果很好吃 → 苹果 [0.2, 0.5, ...] 苹果发布了iPhone → 苹果 [0.2, 0.5, ...] ← 相同向量语义不同ELMo 让同一个词在不同句子中获得不同的向量这是质的飞跃。2. 确立了预训练 微调的两阶段范式ELMo 的使用方式是预训练好的语言模型作为特征提取器将其输出向量接入下游任务模型。大规模无标注语料预训练 BiLSTM → 提取词向量 → 接入下游任务分类、QA、NER等这一范式直接启发了后续的 GPT 和 BERT。3. 证明了深度层表示的互补性ELMo 发现不同 LSTM 层编码不同层次的信息层级捕获的信息底层句法/词法特征中层语义特征顶层任务相关特征通过加权融合所有层下游任务可以自适应地利用不同层次的信息。4. 在多项 NLP 任务上取得显著提升ELMo 接入下游任务后在 6 大基准任务上刷新了当时的最优成绩任务提升幅度命名实体识别NER2.06% F1情感分析SST-56.2% 准确率自然语言推断SNLI1.0% 准确率语义角色标注SRL3.2% F1核心共指消解1.6% F1问答系统SQuAD4.2% F1三、在预训练语言模型谱系中的位置Word2Vec/GloVe (2013) ← 静态词向量 ↓ ELMo (2018) ← 上下文词向量特征级融合 ↓ GPT (2018) ← 单向 Transformer 微调 ↓ BERT (2018) ← 双向 Transformer 微调里程碑 ↓ T5 / GPT-3 / LLaMA ... ← 统一序列到序列 / 大规模涌现ELMo 的局限性局限说明LSTM 架构长距离依赖建模能力弱于 Transformer 的自注意力机制单向信息融合前向和后向是独立训练的拼接而非真正双向交互BERT 通过 Masked LM 解决了此问题特征级融合ELMo 向量作为冻结特征接入下游模型而非端到端微调整个预训练模型BERT 的微调方式更优四、总结ELMo 的历史贡献可以概括为三个关键词上下文化— 词向量从静态走向动态解决了多义词问题预训练范式— 确立了大规模无监督预训练 → 下游任务应用的两阶段框架层次融合— 证明了不同深度层表示的互补价值虽然 ELMo 很快被基于 Transformer 的 BERT 等模型超越但它完成了从静态词向量到预训练语言模型的关键过渡是 NLP 发展史上承前启后的重要里程碑。
返回列表