AI圈报
论文研究普通

RIDE:在表征空间外推 RL 诱导方向,让学生模型逼近或超越教师模型

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:The Teacher Is a Direction, Not a Destination: Extrapolating RL-Induced Representation Residuals in On-Policy Distillation

内容摘要

RIDE(RL-Induced Direction Extrapolation)将强化学习相对基座检查点的表征偏移作为方向,在每一层和每个 token 位置计算教师与其 RL 前检查点的残差,并把学生隐状态回归到沿该残差外推的目标上。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-d807a86c18de6ab51c2334c2