AI圈报
论文研究普通

LoGRA:用低秩梯度草图扩展 LLM 强化学习

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:LoGRA: Scaling LLM Reinforcement Learning with Low-Rank Gradient Sketches

内容摘要

LoGRA 通过低秩梯度草图保留学习信号,将 LLM 强化学习后训练的平均训练内存最多降低 45.7%,且不牺牲性能。该方法结合 predicted-KL 步长控制,避免过大更新破坏训练,并能在单个八卡节点上稳定训练 27B 参数模型超过 1,100 步,而稠密 Adam 在此场景下会内存耗尽。代码已在库中开源。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-c847075df8263afe2ddba382