论文研究普通
1% 的 Token 就够了:论在线策略蒸馏中的梯度估计
原始标题:1% of Tokens Can Be Enough: On Gradient Estimation in On-Policy Distillation
内容摘要
研究发现在线策略蒸馏(OPD)中,仅需 0.1%-1% 的 token 预算即可匹配甚至超越全量 OPD。作者从信息几何角度提出信息效率比(IER),基于信噪比分解刻画最优标量基线下的相对梯度估计误差,并据此进行 token 选择。在数学与医学推理任务上,将 IER 与现有有用性评分结合可改进多种设置下的选择器,同时保留采样的反向 KL 训练目标。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-cbdd8f198d81017c534484aa