AI圈报
论文研究普通

Baseten Base Labs 实验研究蒸馏何时有助于强化学习

信息来源:Baseten Base Labs:模型研究·
原始标题:When does distillation help reinforcement learning?

内容摘要

Baseten Base Labs 发布研究,用 Qwen3 的 0.6B、1.7B、4B、8B 模型比较 GRPO 直接训练与先用 gpt-5.6-sol 教师解法做 SFT 再 RL,覆盖十六个推理任务。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Baseten Base Labs:模型研究
站内情报编号intel-f4c3e762b45a58820155ba3d