论文研究普通
当 EOS Token 不一致:理解在线策略蒸馏中的长度膨胀
原始标题:When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation
内容摘要
研究发现在线策略蒸馏(OPD)中,基础学生模型与后训练教师模型即使声明的停止集合相同,也可能将停止概率放在不同的 EOS token 上,这种终止 token 不匹配会抑制学生模型偏好的终止动作,导致回复过长甚至耗尽生成预算。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-f4b09e0bdc233ab959a21c82