AI圈报
论文研究普通

Meta Superintelligence Labs 提出 Sharpening Tax:RL 后训练提升 pass@1 但损失测试时扩展性

信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI)·
原始标题:Great paper for all you pre-training and post-training nerds. The surprising finding is that pre-trained LLMs, equipped with a light infe...

内容摘要

Meta Superintelligence Labs 等发表论文,发现带轻量推理框架的预训练 LLM 在足够采样预算下解决智能体任务的覆盖面常超过 RL 后训练版本,如 BFCL v4 多轮、ACEBench 和 WebShop 上后训练模型赢在 pass@1,但基座模型在大 K 下常解出后训练模型从未解出的任务。研究将这一测试时扩展性损失命名为 Sharpening Tax,在 14 个基座/后训练配对、4 个模型族、3 个基准共 42 对中大多成立,随模型规模增大,可由少量 rollout 估计;提出的 PTGS 在 RL 中按提示估计难度设置采样温度,税更小且提升 pass@1。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Elvis Saravia (@omarsar0, DAIR.AI)
站内情报编号intel-7fc9ca4bb53613edb913cde9