论文研究普通
研究分析 On-Policy Distillation 机制并提出无监督方法 OPSA
原始标题:Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement
内容摘要
论文定量分析 on-policy distillation(OPD)训练中的教师监督,发现其噪声随教师规模增大而增加,且学生策略对该噪声不敏感。学习集中在低 log-probability token 上,用单一固定负优势即可匹配教师提供的信号,表明 OPD 主要通过抑制低概率 token 起作用而无需教师。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-54922e52973c0a3c30a21d83