论文研究普通
大语言模型在线策略蒸馏真的需要 KL 散度吗?——C-MOPD 多教师蒸馏方法
原始标题:Do We Really Need KL Divergence for On-Policy Distillation of Large Language Models?
内容摘要
研究发现,大语言模型在线策略蒸馏(OPD)或许并不需要 KL 散度:只要让更新方向朝向教师模型即可,甚至仅对教师与学生分歧强烈的一小部分 token 保持正确更新方向,训练依然有效。基于此提出 Consensus Multi-Teacher On-Policy Distillation(C-MOPD),让每个样本受所有教师监督,在数学和代码基准上持续优于 MOPD。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-20088f09ddfa6f3535ccf825