论文研究普通
自对弈搜索蒸馏 SPSD:用 MuZero 式自对弈数据提升 LLM 推理能力
原始标题:Self-Play Search Distillation for Large Language Model Reasoning
内容摘要
研究者提出 Self-Play Search Distillation(SPSD),通过棋盘游戏上训练的 MuZero 式网络自对弈生成超人类合成数据,将搜索记录转为超人类思维链,用环境监督训练 LLM。在 Qwen3-4B-Base 上,六个数学基准的平均分从 24.1 提升至 36.6,留出游戏胜率从 15% 升至 45%。该方法仅用自对弈搜索记录训练,却能迁移到未见过的数学任务。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-35cfa7e48ed8c05a8761282f