论文研究普通
RGPO:用自适应理由脚手架让大模型学会推理
原始标题:Rationale-Guided Policy Optimization: Learning to Reason with Adaptive Rationale Scaffolding
内容摘要
研究者提出 Rationale-Guided Policy Optimization(RGPO),按模型当前能力自适应利用标准答案中的理由信息,并将其作为临时脚手架而非固定模仿目标,只把更高奖励的模型自生成解法回传到无引导设置。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-4424187a2b1a715d0f98cf92