AI圈报
论文研究普通

PMOPD:多教师在线策略蒸馏中的任务排序、循环与参数更新子空间保护

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:PMOPD: Task Ordering, Cycling, and Parameter-Update Subspace Protection in Multi-Teacher On-Policy Distillation

内容摘要

针对多教师在线策略蒸馏(MOPD)中的能力跷跷板问题,研究者提出 PMOPD,通过从各任务累积参数位移构建子空间记忆,对梯度和优化器更新做投影以消除跨任务干扰,并配合轻量冲突探针指导任务排序与循环策略。在 Code、Reason、Math 任务上,PMOPD 全面优于 MOPD,Qwen2.5-7B 平均分提升 2.54 分,Llama-3.1-8B 提升 2.09 分。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-9ffda4dcebbf1f13f046c9eb