AI圈报
论文研究普通

论文提出 Sharpening Tax 量化 RL 后训练的解覆盖损失

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Sharpening Tax in Post-Training

内容摘要

论文研究了 LLM 的 RL 后训练是否只锐化基座已有行为的问题,发现在智能体任务上,带轻量推理框架的预训练模型虽 pass@1 更低,但在足够测试预算下 pass@K 常超过后训练模型。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-644c436b66c4eaf02c9a1e5c