论文研究普通
Where the Model Changes Its Mind:用后见分歧定位实现高效可验证奖励强化学习
原始标题:Where the Model Changes Its Mind: Hindsight-Divergence Localization for Efficient Reinforcement Learning with Verifiable Rewards
内容摘要
研究者提出 Hindsight-Divergence Localization(HDL),利用后见诱导的 token 对数似然变化来选取分支点,只从关键位置生成续写并仅用新生成的后缀更新策略。在数学、代码和智能体任务上,相比同等组规模与训练步数的 GRPO,HDL 生成 token 最多减少 2.5 倍、rollout 墙钟时间提速 1.8 倍,智能体任务性能最高提升 12.5 分。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-fe33ed1ef23bca861c4e69e7