AI圈报
论文研究普通

弱到强泛化新方法:On-Policy Reverse Distillation 让强模型超越弱教师

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation

内容摘要

研究者提出 On-Policy Reverse Distillation(OPRD),通过评估教师模型在学生轨迹上的策略偏移,仅放大验证器支持的更新方向,使强学生模型在向弱教师学习时超越教师能力上限。在连续模型迁移和多教师蒸馏中,OPRD 以更少的学生更新次数取得比现有 RL 和蒸馏方法更高的性能,且学生模型更接近纯验证器 RL 训练结果而非弱教师。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-7c8a2dcca1859afe667d61c0