AI圈报
论文研究普通

CorrGRPO:面向多奖励学习的相关性归一化 GRPO

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:CorrGRPO: Correlation-Normalized GRPO for Multi-Reward Learning

内容摘要

针对 GRPO 在多奖励场景下归一化易被大尺度相关奖励主导的问题,研究者提出 CorrGRPO,将成对协方差归一化为 Pearson 相关系数,在保持中心化总奖励不变的同时平衡不同尺度奖励的影响。在代码生成、工具调用和智能体安全三类任务上,使用 0.5B 至 8B 参数模型与 GRPO 及其他变体对比,三个领域均取得提升,代码已开源。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-b052e5a5fbd50e71f3677529