AI圈报
论文研究普通

蒸馏学习该用 On-Policy 还是 Off-Policy?一项系统性研究

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics

内容摘要

研究在 Llama3 与 Qwen2.5 系列上做强弱蒸馏实验,独立改变 rollout 策略、token 级 KL 方向和学习率,发现 rollout 策略并非核心因素:前向 KL 对 rollout 策略极不敏感且表现稳定,反向 KL 则明显更敏感、偏好学生模型自生成的 rollout,而学习率主导遗忘与更新稀疏性。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-d3688873060f3cfd0a1854b1