RWKV 一个可并行训练的 RNN

RWKV 一个可并行训练的 RNN
一、开篇:一个可并行训练的 RNN2021 年前后,一位名叫Bo Peng(彭博)的独立研究者开始了一个雄心勃勃的开源项目。他想回答一个看似"反潮流"的问题:在 Transformer 统治一切的时代,RNN 真的死了吗?能不能造一个既像 Transformer 那样能并行训练,又像 RNN 那样能高效推理的架构?这个项目就是RWKV——名字来自它的四个核心组件:Receptance、Weight、Key、Value。它常被描述为一句话:“一个可以像 Transformer 那样并行训练的 RNN。”时代背景:Transformer 的甜蜜与烦恼2017 年 Transformer 横空出世后,凭借自注意力机制和完全并行的训练,迅速统治了自然语言处理乃至整个深度学习。GPT、BERT、LLaMA 等一系列模型都建立在 Transformer 之上。但 Transformer 有一个结构性的痛点——自注意力的复杂度是序列长度的平方