AI圈报
论文研究精选

KPop 新方法让 Ring-2.6-1T 在 SWE-bench Verified 上突破 76 分

信息来源:X:蚂蚁百灵 (@AntLingAGI)·
原始标题:From IcePop to KPop - our team keeps pushing on RL training stability for large MoE models. 👇 KPop…

内容摘要

团队推出 KPop,用于稳定大规模 MoE 模型的智能体强化学习训练。它用基于二元 KL 散度的自适应掩码机制,替代了此前 IcePop 方法中的固定比例掩码,能根据训练过程中的训练-推理不匹配程度动态调整。这一改进使得 Ring-2.6-1T 模型在无需修改基础设施或路由重放的情况下,仅通过纯 RL 训练,在 SWE-bench Verified 上取得了超过 76 分的成绩。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:蚂蚁百灵 (@AntLingAGI)
站内情报编号intel-d0ac2f212c885852582218ea