模型发布 / 更新普通
腾讯混元:LLM 强化学习批大小扩展研究
原始标题:⚡️ As LLM reinforcement learning scales to larger GPU clusters and more training data, training effi…
内容摘要
腾讯混元研究发现,在 GRPO 和 PPO 中重新调整学习率可在有限批大小范围内保持每条响应的学习效果。在固定硬件上,扩大批大小使 PPO 生成阶段吞吐量最高提升 2.29×,最佳 GRPO 配置以少 29% 的时间达到相同验证目标。该研究将经典临界批大小理论扩展至在线 LLM 强化学习场景。
内容分类AI 模型发布与更新
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:腾讯混元 (@TencentHunyuan)
站内情报编号intel-7aa0bef63e9e5e30cc2399aa