观点 / 方法普通
Fireworks 实验揭示:RL 训练中数值对齐与 MoE 路由为何关键
原始标题:Reinforcement learning: Why alignment of numerics and MoE routing matter
内容摘要
Fireworks 在 GLM 5.2 上做同一 RL 任务实验,训练端与 rollout 引擎概率计算不一致时 KL 约 0.013、每批约 45% 样本被丢弃,reward 在约第 20 步从 0.9 崩到 0.2 以下;对齐后 KL 为 0、reward 全程稳定。