论文研究普通
当大模型强化学习走向规模化,Batch Size Scaling 有什么不一样?
内容摘要
腾讯混元研究团队从第一性原理分析 LLM 强化学习中的 batch size scaling,提出以 time-to-target 为判据:只有当吞吐增益 r_q 超过样本代价 r_N 时,更大的 batch 才能缩短训练时间。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源腾讯混元:Research(API)
站内情报编号intel-1fc3952d79bc168cead6ee19