AI圈报
论文研究普通

让 LLM 在 RL 中永不放弃:NGU 自适应采样方法解决难题

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Learning to Solve Hard Problems in RL for LLMs by Never Giving Up

内容摘要

研究提出 Never Give Up(NGU)自适应采样方法,通过异步 RL 持续为同一问题生成样本直到答对,将算力从简单题重新分配到难题。作者指出 RL 对 LLM 的提升存在"马太效应":简单题提升大、难题提升小。在数学基准 Deepscaler 上 NGU 提升了单位算力性能,在编程任务 Manufactoria 上标准 GRPO 无法完全解题,NGU 则迭代攻克越来越难的测试直至完全解决。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-1d9a5095687e2b294856709c