论文研究普通
DuoOPD:用师生联合结果做多任务在线策略蒸馏
原始标题:DuoOPD: Learning from Joint Teacher-Student Outcomes for Multi-Task On-Policy Distillation
内容摘要
DuoOPD 提出一种多任务在线策略蒸馏方法,由学生结果决定反馈方向、师生联合结果决定教师如何支持:仅教师答对时用其答案作为评分上下文,仅学生答对时按任务内共享权重强化整段回答。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-b078d26ac990de25bb398880