ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget

LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget LongStraw 论文完整梳理(arXiv:2607.14952)一、论文整体概述与核心创新点(一)研究背景与痛点推理与RL训练上下文鸿沟:当下大模型推理已支持百万级上下文,但GRPO等RL后训练普遍限制在256K token以内;AI智能体需要超长轨迹(工具调用、多轮文档、历史决策)做强化学习,现有方案无法满足。RL训练显存致命瓶颈:推理仅需缓存KV,无需保存完整计算图;但RL训练要对多条共享长Prompt的回答分支打分+反向传播,完整序列自注意力带来二次显存开销,大量反向激活张量导致OOM。传统方案依赖扩容GPU:Ring Attention、DeepSpeed-Ulysses等长上下文训练方法依靠增加GPU数量分摊负载,中小团队无大规模集群,硬件门槛极高。(二)LongStraw 核心创新(四大核心贡献)分阶段无梯度前缀捕获+串行分支重放核心机制长Prompt仅执行1次无梯度前向,只保留模型推理必需的架构专属状态(丢弃所有中间激活、FFN缓存、路由张量);多条回答分支串行重放,同一时间仅维持单条回
返回列表