- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月16日 13:00
- 状态
- 单一信源
发生了什么
LongStraw是一种架构感知的执行栈,用于在固定GPU预算下实现超过2M标记的长上下文强化学习后训练。它通过不自动求导共享prompt、仅保留模型特定状态、一次回放一个短响应分支等机制,在8个H20 GPU上完成了Qwen3.6-27B和GLM-5.2的2.1M位置评分与反向传播,组大小增加仅增加0.21GB显存;在32个H20 GPU上验证了2.1M token prompt的GLM-5.2全部78层执行。这些实验仅证明执行容量,未验证完整训练正确性。
为什么重要
此前推理系统已接近百万token上下文,而后训练通常限于256K token,依赖部署时长度泛化。LongStraw在同样GPU预算下将后训练上下文扩展至2M token以上,显著缩小了推理与后训练之间的长度差距,使AI代理等长轨迹应用能在后训练阶段直接处理更长序列,降低了对长度泛化的依赖。
底层逻辑
LongStraw采用架构感知策略:对共享prompt禁用自动求导以节省显存,仅保留后续token所需的模型状态;将长上下文拆分为短响应分支依次回放,以额外计算时间换取减小实时训练图的内存占用。基于GRPO,在混合递归/全注意力的Qwen3.6-27B和压缩注意力混合专家GLM-5.2上实现,验证了扩展execution capacity而非完整训练正确性。
产品与商业机会
研发团队可在固定GPU预算(如8张H20)下进行百万token级别的RL后训练,降低长上下文训练硬件门槛;AI agent产品的训练数据可包含更长的观测、工具输出和决策历史;训练流程需引入分支回放和prompt分离逻辑,但可能增加训练时间。
- 将LongStraw集成到Koala、OpenRLHF等开源RL训练框架,支持2M+ token上下文后训练
- 基于LongStraw开发面向AI agent的长轨迹RL后训练服务,使agent能学习处理完整对话历史
- 在8 GPU预算下测试LongStraw对Qwen或GLM模型的长上下文微调效果,验证训练正确性
- 针对混合专家模型(如GLM-5.2)优化LongStraw的稀疏激活与内存管理,提升大模型长上下文训练效率
仍待确认
- LongStraw的完整训练正确性(如梯度准确性、收敛性)是否已在更大任务上验证?
- 在更大GPU集群(如64以上)或不同模型架构(纯Transformer)上,LongStraw的性能和扩展性如何?
- 与Ring Attention、FlashAttention等长上下文训练方案相比,LongStraw在相同显存下的实际训练吞吐如何?
- LongStraw是否支持比2.1M更长的上下文(如4.46M stress test)下的稳定训练?