论文研究普通
OASIS:突破 LLM 推理在线自蒸馏的规模扩展瓶颈
原始标题:Overcoming Scaling Limits in On-Policy Self-Distillation for LLM Reasoning
内容摘要
针对在线自蒸馏(OPSD)随模型规模增大而失效的问题,研究者提出 OASIS,仅用最终答案标签、以经核验的在线轨迹为主要监督信号,并用模型自生成尝试替代参考解答作为教师上下文。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-dc1b8b6a9d79c02c873c23f9