论文研究普通
OPD Before RL:用同策略蒸馏为基于评分标准的 RL 预热
原始标题:OPD Before RL: Warm-Starting Rubric-Based RL with On-Policy Distillation
内容摘要
研究提出两阶段训练框架,先用评分标准作为特权教师上下文做同策略蒸馏(RP-OPD),再以评分标准为奖励进行 RL。在 HealthBench、ResearchQA 和 RubricHub Science 上,该框架得分高于所评估的各类后训练方法。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-fbfd14f752ab3e09dc540536