AI圈报
论文研究精选

KPop:用对称二元KL散度解决大模型强化学习的训练推理不一致问题

信息来源:公众号:蚂蚁百灵(Ling)·
原始标题:解决大模型的"人格分裂":KPop 如何应对强化学习的训练推理不一致问题

内容摘要

蚂蚁百灵团队提出KPop方法,应对大模型强化学习中训练与推理引擎概率分布不一致导致的训练崩溃。KPop用对称二元KL散度替代IcePop的固定比值阈值,仅需一个超参数,对稀有token自适应宽容、对高频token严格约束。在Ring-flash-2.0(总参100B)上支撑800+步稳定RL训练,SWE-bench Verified从70.8%提升至76.28%。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源公众号:蚂蚁百灵(Ling)
站内情报编号intel-a2ff380709b2a03268e11d43