PatchTST:通道独立的、切片的 时序 Transformer
如有侵权或其他问题欢迎留言联系更正或删除。目录一 模型主要思想及预实验二 Method三 实验结果出处ICLR 2023代码链接yuqinie98/PatchTST: An offical implementation of PatchTST: A Time Series is Worth 64 Words: Long-term Forecasting with Transformers. (ICLR 2023) https://arxiv.org/abs/2211.14730一 模型主要思想及预实验1. Patch 思想Input Token将各时间点视为单一 tokenPatch时间序列被分为若干时间段 (segment)各时间段被视为单一 token提取局部语义信息2. 关于通道混合 Channel-mixingCD / CM 和通道独立 Channel-independenceCI 通道混合通道混合 Channel-mixingCD / CM强调不同通道间的 “相关性、交互性” 建模提高模型的表达能力及泛化能力一个模型处理多个所有通道的时序信息Transformer 架构的 “通道混合”1) 自注意力机制每个位置的表示都是所有位置的加权组合2) 多头注意力机制不同注意力头内学习不同的特征表示并进行合并通道独立 Channel-independenceCI一个模型只处理一个通道的时序信息3. 预实验二 Method2.1 通道独立性Channel-independence针对多元时序数据按其 “变量数”M将其拆分为 M 个 “单变量时序数据”针对每个单变量时序数据使用 “单独的 transformer backbone” 处理最终汇聚多个变量各自的预测结果。2.2 Patch 操作举个实际例子帮助理解(1) 通过图示直观理解公式内的 “( L - P ) / S” 的含义(2) 理解 “2” 加的是首部的第一个 Patch以及 “除不尽/需padding” 情况下尾部的最后一个 Patch除得尽就只需 “1”添加首部的第一个 Patch(3) 之前的部分工作是将每个时间戳当作一个 token故其时间复杂度为O(L)而当我们采取 “Patch” 策略则以 一个 Patch 为 一个 token又因为 L P故其时间复杂度可近似为O(L/S)— 效率提升2.3 Transformer Encoder多头注意力机制2.4 损失函数如下2.5 Instance Normalization帮助减轻 “训练、测试数据” 间的分布偏移效应 (Ulyanov et al., 2016; Kim et al., 2022)2.6 “自监督” self-supervised策略 的 表示学习论文阐述了在自监督学习中通过分块patch对掩码mask进行重建的优势如果仅对单一时间点进行掩码处理那么直接利用相邻时间点的数据进行插值即可轻易实现重建这种方式几乎不需学习就能够完成任务。然而当采取对一个数据块patch进行掩码并尝试重建时这种方法不仅更加具有挑战性而且能够赋予模型更高的学习价值因为这要求模型理解并利用数据的整体结构和模式而不是简单地依赖于局部信息的插值。这样做的结果是提高了模型的泛化能力和对复杂模式的捕捉能力。三 实验结果“有监督” 的实验结果“自监督” 的实验结果迁移学习表示学习PS. 虽然在消融实验内“通道独立性” 效果不错但实际上现在的 sota 工作更倾向于 “通道混合” 或者采取介于 “CI / CD” 的中间状态。