AI圈报
论文研究普通

TGRL:用温度分组强化学习提升 LLM 探索效率

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:TGRL: Temperature-Grouped Reinforcement Learning for Efficient Exploration in LLMs

内容摘要

研究者提出 Temperature-Grouped Reinforcement Learning(TGRL),将温度带来的 rollout 多样性转化为显式训练信号:把同一 prompt 的 rollout 组分为低温和高温子集,用两组奖励差异估计探索增益,并借助 JS 散度将组级信号分配为 token 级信用。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-4044bfbfde10fa3136c9c775