论文研究普通
大模型 On-Policy Distillation 再思考 II:一条训练样本就够了
原始标题:Rethinking On-Policy Distillation of Large Language Models II: One Training Example
内容摘要
研究探讨 on-policy distillation(OPD)中训练数据的作用,发现仅用 1 条 query 训练即可持续提升数百步并恢复全量数据 OPD 的大部分增益。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-1986461822ab466096c851e8