论文研究普通
RIDE:在表征空间外推 RL 诱导方向,让学生模型逼近或超越教师模型
原始标题:The Teacher Is a Direction, Not a Destination: Extrapolating RL-Induced Representation Residuals in On-Policy Distillation
内容摘要
RIDE(RL-Induced Direction Extrapolation)将强化学习相对基座检查点的表征偏移作为方向,在每一层和每个 token 位置计算教师与其 RL 前检查点的残差,并把学生隐状态回归到沿该残差外推的目标上。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-d807a86c18de6ab51c2334c2