AI圈报
论文研究普通

MoE 强化学习中的专家空间探索:ESRL 框架让 Qwen3-30B-A3B 的 Pass@1 提升 3.2 个百分点

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Expert-Space Exploration in MoE Reinforcement Learning

内容摘要

研究者提出 Expert-Space Exploration Reinforcement Learning(ESRL),一个显式探索 MoE 模型专家路由空间的架构感知框架,通过保留高置信度专家作为锚点、将随机路由限制在合理候选池内,并按 router 熵自适应调整扰动强度。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-3f572832a3896d1d3e4af23f