论文研究普通
研究发现 on-policy 参数更新方向是 LLM 后训练泛化关键,提出 OPSFT 方法
原始标题:On-Policy Parameter Update Direction Underlies Generalization in LLM Post-Training
内容摘要
研究提出 On-Policy 方向约束监督微调(OPSFT),将 SFT 的参数更新约束到 on-policy 范式识别出的更新方向上,从而把 on-policy 的泛化优势迁移到 SFT。分析显示 SFT 沿一致方向更新参数,而 on-policy 范式在训练中持续调整方向。OPSFT 兼具 on-policy 的强泛化与 SFT 的高训练效率和利用高质量轨迹的能力。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-a9948da74f4f2cfbbc6ce272