AI圈报
论文研究普通

Cliff:从第一个错误学习过程奖励的 RLVR 奖励塑形策略

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Cliff: Learning Process Rewards from the First Mistake

内容摘要

论文提出 Cliff,一种奖励塑形策略,用现成 LLM 作为教师识别每次 rollout 中的第一个错误,将 rollout 分解为正确前缀和错误后缀,分别赋予正负 token 级优势。实验覆盖 12 个场景,Cliff 比.on-policy distillation 高 15%,比标准 GRPO 高 7%,即使教师能力一般也有效。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-60dcefcc3632f3a90b1164cd