论文研究普通
更小的模型,更好的拒绝样本:偏好蒸馏的规模规律
原始标题:Smaller Models, Better Rejects: Preference Distillation Scaling
内容摘要
偏好蒸馏中,用更小的冻结模型生成拒绝样本,比学生模型自生成样本训练效果更强,且推理算力更低。研究在 7B 到 72B 学生模型上验证了这一点,覆盖代码生成与数学推理任务,序列级知识蒸馏前后均成立。作者还给出 DPO 的有限时域效用上界,并据此提出混合不同规模拒绝样本、打乱 token、优先选择参考策略下低概率候选三种改进手段。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-adc754f99cf8dfadb1f3d040