AI圈报
观点 / 方法普通

Fireworks 实验揭示:RL 训练中数值对齐与 MoE 路由为何关键

信息来源:Fireworks AI(网页)·
原始标题:Reinforcement learning: Why alignment of numerics and MoE routing matter

内容摘要

Fireworks 在 GLM 5.2 上做同一 RL 任务实验,训练端与 rollout 引擎概率计算不一致时 KL 约 0.013、每批约 45% 样本被丢弃,reward 在约第 20 步从 0.9 崩到 0.2 以下;对齐后 KL 为 0、reward 全程稳定。
内容分类AI 观点与方法
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Fireworks AI(网页)
站内情报编号intel-a5673a393cbd0b22b799faa2