论文研究普通
无需搜索的锐化:序列级幂分布的在策略蒸馏(OPPD)
原始标题:Sharpen Without Search: On-Policy Distillation of Sequence-Level Power Distribution
内容摘要
研究者提出在策略幂蒸馏(OPPD),让模型在单次生成中直接产出幂分布采样才能得到的答案:训练时由模型生成候选、冻结教师模型按幂分布加权,同一概率用于最大似然更新。在 MATH500 和 GSM8K 上,单次生成准确率较未训练模型分别提升最高 23.0 和 27.3 分,比已发表的 64 候选幂采样高 2.4 和 3.5 分。仅用数学数据训练,HumanEval 准确率最高提升 5.3 分。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-52f729ded5a6a80a836d9b84