AI圈报
论文研究普通

大规模长上下文 RL 后训练中的在线草稿协同训练:面向投机解码的系统设计

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Online Draft Co-Training for Speculative Decoding in Large-Scale, Long-Context RL Post-Training

内容摘要

针对投机解码在大规模长上下文 RL 后训练中的扩展难题,研究者提出一套端到端在线草稿协同训练系统。该系统通过扩展 zigzag ring attention 支持分支注意力,并借助 TapChannel 跨流水线并行阶段传输中间特征。实验显示,协同训练的草稿在最高 122B 参数规模上紧密跟踪策略基线,并在 256K token 下实现强扩展和显著内存节省。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-27d5b633c10a0bae79c8f515