ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

RWKV-8前瞻:RWKV-LM下一代RNN的ROSA 1-bit/4-bit量化状态实验终极指南

RWKV-8前瞻:RWKV-LM下一代RNN的ROSA 1-bit/4-bit量化状态实验终极指南 RWKV-8前瞻RWKV-LM下一代RNN的ROSA 1-bit/4-bit量化状态实验终极指南【免费下载链接】RWKV-LMRWKV (pronounced RwaKuv) is an RNN with great LLM performance, which can also be directly trained like a GPT transformer (parallelizable). We are at RWKV-7 Goose. So its combining the best of RNN and transformer - great performance, linear time, constant space (no kv-cache), fast training, infinite ctx_len, and free sentence embedding.项目地址: https://gitcode.com/gh_mirrors/rw/RWKV-LMRWKV-LM 开源项目中的 RWKV-8 Heron 正在用 ROSARapid Online Suffix Automaton快速在线后缀自动机做 RNN 状态量化实验把状态压到 1-bit 和 4-bit用极小的状态开销换来精确记忆能力。本文将带你读懂这些实验的原理、结果和它意味着什么。RWKV 与 RNN 状态为什么值得量化先简单回顾背景RWKV 是一种像 Transformer 一样并行训练、像 RNN 一样逐步推理的线性时间大语言模型。它的推理状态不随上下文长度增长没有 kv-cache这是它最迷人的特性之一。但在 RWKV-8.md 的路线图里作者提出了一个关键维度——Qbits状态精度RNN statesz f(B, H, N, L,Q)也就是说状态大小 批大小 × 头数 × 头维 × 层数 ×每状态位的比特数。量化状态quantized state正是缩小状态、提升大 batch 并行推理上限的直接手段。而 RWKV 训练效率与 MHA 注意力相当也让换掉状态表示成为一个低风险实验ROSA 是什么自带精确记忆的状态ROSA 是一个在线构建的后缀自动机Suffix Automaton它一边读入序列一边把所有已出现过的子串压成一棵字典树式结构并回答这个子串上次出现之后跟的是什么。它的两个特性对语言模型极其有用免费句法嵌入每个位置自动获得上文最远匹配的表示等价于一种精确的检索记忆精确复制copy模型可以直接从状态里抄出之前见过的 token不需要靠参数死记。而实验的核心问题是ROSA 的输出信号本身要不要高精度能不能把内部表示压到 1 个比特1-bit 量化状态如何实现核心实现在 RWKV-v8/251014_rosa_1bit_layer.py每个隐藏维度取符号位bit (x 0)状态信息被压到每维 1 bitROSA 在这条 0/1 序列上在线匹配得到每个位置的上文匹配结果匹配结果只有三种未匹配、匹配到 0、匹配到 1——分别输出两个可学习向量emb0/emb1未匹配输出 0 向量。也就是说整个 ROSA 层除了两个 C 维向量外几乎没有参数却保留了完整的子串记忆结构。反向传播则采用翻转单个 bit 重跑 ROSA的直白梯度估计注释里自嘲extremely slow——这是典型的先验证想法、后优化工程的做法。4-bit 量化4 个比特打包成 16 进制 tokenRWKV-v8/251018_rosa_4bit_run.py 把思路推进了一步把 4 个隐藏维度一组各取符号位按b0 | b11 | b22 | b33打包成一个 0~15 的十六进制 nibbleROSA 在这个 16 进制序列上匹配等价于把状态精度提到 4 bit匹配出的 nibble 再拆回 4 个 bit分别查emb0/emb1输出向量。多层堆叠时脚本里叠了 4 层 ROSA 线性层4-bit 状态在精确复制类任务上的精度显著高于 1-bit且仍远小于普通 fp32 状态。实验结果三组值得记住的数字实验配置结果仅 EmbROSA无量化层C641000 步loss ~0.65见 251014_rosa_onlyemb_train.pyEmbROSA 1-bitROSA1 层 / 2 层loss ~0.4见 251014_rosa_1bit_train.pyEmbROSA 4-bit × 4 层C64loss ~0.25见 251018_rosa_4bit_run.py上图为该实验的完整 loss 曲线黄色 4-bit×4 层最低黑色纯 EmbROSA 最高。更惊人的是几个极小规模模型的表现40K 参数L2-D32RWKV7ROSA反转 1~60 位数字digit 精度99.8%——见 251105_reverse_run.py1M 参数在 40 位数字加减法上达到99%digit 精度且无需 CoT 推理——见 251024_rosaQKV_run.py0.1B 语言模型L12-D768 的纯 ROSA-1bit FFN 模型不含 RWKV 主干仅用 minipile 1.5B token 训练就已具备完整的复制与计数能力——见 260212_rosa1bitLM_L12.py 与 4-bit 版本 260222_rosa4bitLM_L12.py。这意味着什么 量化状态的可行性被提前验证1-bit/4-bit 状态不是无损的但在精确记忆型能力复制、计数、算术上几乎不损失——而这恰是 Transformer 长上下文最痛的地方状态大小公式里的 Q 维度真正落地如果未来 RWKV-8 把 Q 从 16/32 bit 压到 1~4 bit同等显存下 batch size 可以提升一个数量级直接利好大规模并行 prefill 解码的推理范式免费精确嵌入 低精度状态的组合让 RNN 在检索类任务上可能比注意力机制更省。快速上手资源实验总览与社区 ROSA 项目索引RWKV-v8/README.mdRWKV-8 状态改进路线图更大/更小/混合状态RWKV-8.md1-bit 层核心实现含梯度推导RWKV-v8/251014_rosa_1bit_layer.py0.1B minipile 语言模型推理RWKV-v8/260212_rosa1bitLM_L12.py、RWKV-v8/260222_rosa4bitLM_L12.pyRWKV-8 仍处于研究阶段但这些实验已经给出强烈信号下一代 RNN 的状态可能比你想象的比特更少。【免费下载链接】RWKV-LMRWKV (pronounced RwaKuv) is an RNN with great LLM performance, which can also be directly trained like a GPT transformer (parallelizable). We are at RWKV-7 Goose. So its combining the best of RNN and transformer - great performance, linear time, constant space (no kv-cache), fast training, infinite ctx_len, and free sentence embedding.项目地址: https://gitcode.com/gh_mirrors/rw/RWKV-LM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表