AI圈报
论文研究普通

DARA:面向多奖励强化学习的密度感知奖励聚合方法

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Make Sparse Rewards Count: Density-Aware Reward Aggregation for Multi-Reward RL

内容摘要

针对多奖励强化学习中各目标学习进度不均的问题,研究者提出密度感知奖励聚合方法 DARA,通过逆平方根密度校正,为激活频率较低的奖励信号赋予更高权重,且不改变底层策略优化目标。在工具调用任务上,DARA 达到高格式合规所需训练步数比 GDPO 最多减少 26%;在数学推理任务上,接近饱和的长度合规所需步数最多减少 65%,最终性能保持竞争力。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-3070d3141ebec3143ed5d9f4