论文研究精选
KPop:用对称二元KL散度解决大模型强化学习的训练推理不一致问题
原始标题:解决大模型的"人格分裂":KPop 如何应对强化学习的训练推理不一致问题
内容摘要
蚂蚁百灵团队提出KPop方法,应对大模型强化学习中训练与推理引擎概率分布不一致导致的训练崩溃。KPop用对称二元KL散度替代IcePop的固定比值阈值,仅需一个超参数,对稀有token自适应宽容、对高频token严格约束。在Ring-flash-2.0(总参100B)上支撑800+步稳定RL训练,SWE-bench Verified从70.8%提升至76.28%。