AI圈报
模型发布 / 更新普通

GRPO 强化学习新方法 Never Give Up 提升难题表现

信息来源:X:Nathan Lambert (@natolambert)·
原始标题:An basic idea in scaling RL: Can we allocate more compute to the harder problems? We did this: If …

内容摘要

针对 GRPO 强化学习在难题上收益有限的问题,研究者提出 "Never Give Up" 方法:当 GRPO 组内所有回答都错误时,以约 0.9 的概率继续采样,以寻找非零梯度的批次,该方法有效。研究将 RL 收益集中在简单题目的现象称为 LLM 强化学习的马太效应,并借助异步 RL 攻克更难问题。
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Nathan Lambert (@natolambert)
站内情报编号intel-032d6533564c0e65ca695d91