论文研究普通
RLVR 研究揭示推理广度在入口处收缩而非内部丢失
原始标题:Locked at the Entrance, Open Inside: Where RLVR Narrows the Solution Space
内容摘要
一项 RLVR 研究发现,可验证奖励强化学习虽提升 pass@1,但使策略解空间最多收缩 67%,且收缩集中在推理入口处,首个算术操作前的 per-token 似然变化是下游推理的 11x-16x。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-d7a47d007c05be9c08f87e91