AI圈报
论文研究精选

从预训练到后训练:理解推理能力的强化学习缩放规律

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Understanding Reasoning from Pretraining to Post-Training

内容摘要

一项新研究以国际象棋为受控实验平台,系统探究了预训练与强化学习(RL)在推理任务中的交互关系。研究发现,给定RL计算量下的后训练性能可由预训练损失准确预测,且RL奖励曲线的斜率随预训练token数近似线性提升。在1B参数数学语言模型上,更长预训练的检查点在RL下性能更高、提升更快。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-377add6fb3e82d304acca15b