AI圈报
论文研究普通

Cal-OPD:校准教师-学生差异的在线策略蒸馏方法

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Calibrating Teacher--Student Discrepancy for On-Policy Distillation

内容摘要

研究者提出 Calibrated On-Policy Distillation(Cal-OPD),通过正负特权干预估计教师自身偏差区域,并据此校准教师-学生差异,仅保留超出该区域的部分作为优化信号。在数学推理基准上,Cal-OPD 仅保留约 52-65% 的原始教师-学生差异,却在各模型规模上持续优于标准 OPD 及其变体。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-e62aacc2b77ef67fe93ac5cb